Qetx Blog
友情链接
往期整理
  •   历史归档
  •   文章分类
  •   文章标签
NotionNext
文章
67
分类
7
标签
4
友情链接
往期整理
历史归档
文章分类
文章标签
Lazy loaded image
技术分享
PPO: Proximal Policy Optimization Algorithms
发布于: 2026-4-9
最后更新: 2026-4-15
次查看
目录
0%
1.背景2.算法2.1 策略梯度方法2.2 信任域Trust Region Methods硬约束方法(Hard Constraint Method)KL惩罚方法(KL Penalty Method)2.3 PPO核心裁剪概率比自适应KL惩罚2.4 PPO计算2.5 优势函数介绍优势函数的估计3.代码实践
NotionNext
NotionNext
一个普通的干饭人🍚
文章
67
分类
7
标签
4
最新发布
Web Machine(N7)(VulnHub)
Web Machine(N7)(VulnHub)
2026-8-18
MacBook M1 VulnHub 靶机搭建:ARM Mac 运行 x86 OVA 镜像
MacBook M1 VulnHub 靶机搭建:ARM Mac 运行 x86 OVA 镜像
2026-8-16
Matrix-Breakout: 2 Morpheus(VulnHub)
Matrix-Breakout: 2 Morpheus(VulnHub)
2026-8-16
HTB Silentium
HTB Silentium
2026-8-16
HTB Kobold
HTB Kobold
2026-8-16
HTB Paperwork
HTB Paperwork
2026-8-16
公告
🎉qetx新博客已经上线🎉
-- 感谢您的支持 ---
这里会有什么?
ctf知识
RL学习笔记
有趣的生活日常
 
目录
0%
1.背景2.算法2.1 策略梯度方法2.2 信任域Trust Region Methods硬约束方法(Hard Constraint Method)KL惩罚方法(KL Penalty Method)2.3 PPO核心裁剪概率比自适应KL惩罚2.4 PPO计算2.5 优势函数介绍优势函数的估计3.代码实践
2025-2026NotionNext.

Qetx Blog | 一个普通的干饭人🍚

Powered byNotionNext 4.10.8.