Qetx Blog
友情链接
往期整理
历史归档
文章分类
文章标签
文章
67
分类
7
标签
4
友情链接
往期整理
历史归档
文章分类
文章标签
技术分享
PPO: Proximal Policy Optimization Algorithms
发布于: 2026-4-9
最后更新: 2026-4-15
次查看
目录
0%
1.背景
2.算法
2.1 策略梯度方法
2.2 信任域Trust Region Methods
硬约束方法(Hard Constraint Method)
KL惩罚方法(KL Penalty Method)
2.3 PPO核心
裁剪概率比
自适应KL惩罚
2.4 PPO计算
2.5 优势函数介绍
优势函数的估计
3.代码实践
NotionNext
一个普通的干饭人🍚
文章
67
分类
7
标签
4
最新发布
Web Machine(N7)(VulnHub)
2026-8-18
MacBook M1 VulnHub 靶机搭建:ARM Mac 运行 x86 OVA 镜像
2026-8-16
Matrix-Breakout: 2 Morpheus(VulnHub)
2026-8-16
HTB Silentium
2026-8-16
HTB Kobold
2026-8-16
HTB Paperwork
2026-8-16
公告
🎉qetx新博客已经上线🎉
-- 感谢您的支持 ---
这里会有什么?
ctf知识
RL学习笔记
有趣的生活日常
目录
0%
1.背景
2.算法
2.1 策略梯度方法
2.2 信任域Trust Region Methods
硬约束方法(Hard Constraint Method)
KL惩罚方法(KL Penalty Method)
2.3 PPO核心
裁剪概率比
自适应KL惩罚
2.4 PPO计算
2.5 优势函数介绍
优势函数的估计
3.代码实践