PPO 概要¶
PPO(Proximal Policy Optimization)用裁剪的代理目标限制策略更新幅度,训练更稳。
核心直觉¶
- 用旧策略采样,重要性采样更新新策略
- 比率 (r_t(\theta) = \frac{\pi_\theta(a_t\mid s_t)}{\pi_{\theta_{\mathrm{old}}}(a_t\mid s_t)})
- Clip 把 (r_t) 限制在 ([1-\epsilon,\,1+\epsilon]),避免一次更新过大
常见配套¶
- GAE:估计优势 (A_t)
- 价值函数 (V_\phi):做 baseline / critic
- 熵正则:鼓励探索
深入阅读¶
倒立摆 Demo 中有手写 PPO 实现与对照讲解:
- 教学站:PPO 算法
- 源码仓库:本地工作区
RL_Demo/src/ppo/