跳转至

PPO 概要

PPO(Proximal Policy Optimization)用裁剪的代理目标限制策略更新幅度,训练更稳。

核心直觉

  • 用旧策略采样,重要性采样更新新策略
  • 比率 (r_t(\theta) = \frac{\pi_\theta(a_t\mid s_t)}{\pi_{\theta_{\mathrm{old}}}(a_t\mid s_t)})
  • Clip 把 (r_t) 限制在 ([1-\epsilon,\,1+\epsilon]),避免一次更新过大

常见配套

  • GAE:估计优势 (A_t)
  • 价值函数 (V_\phi):做 baseline / critic
  • 熵正则:鼓励探索

深入阅读

倒立摆 Demo 中有手写 PPO 实现与对照讲解:

  • 教学站:PPO 算法
  • 源码仓库:本地工作区 RL_Demo/src/ppo/