一阶倒立摆强化学习入门

用完整的马尔可夫决策过程(MDP)建模,配合 Genesis 物理引擎与手写 PPO, 从零学会「观测 → 决策 → 奖励 → 更新策略」的闭环。

MDP 五元组 PPO / GAE Genesis Cart-Pole Balance

你会学到什么

1. MDP 形式化

把「小车推杆」写成 (S, A, P, R, γ),搞清状态、动作、终止条件与奖励设计。

进入 MDP →

2. PPO 为什么能训稳

理解重要性采样比率、clip 目标、价值函数与熵正则,对照本仓库源码逐行读。

进入 PPO →

3. Genesis 仿真

URDF 建模、力控关节、并行环境,以及和控制教材角度约定的对齐方式。

进入仿真 →

4. 跑通一次训练

安装依赖、启动训练、看曲线、评估策略,并对照实验结果页解读指标。

进入训练 →

任务一句话

目标:通过左右推动小车,让摆杆保持在竖直向上附近(|θ| < 12°), 同时小车不冲出轨道(|x| < 2.4 m)。策略由 PPO 从交互数据中学习,无需手写 PID。

项目结构速览

RL_Demo/
├── assets/cart_pole.urdf      # 小车-摆杆 URDF
├── configs/train_config.yaml  # 超参
├── src/mdp/                   # MDP 定义与奖励
├── src/envs/                  # Genesis / 分析动力学环境
├── src/ppo/                   # 手写 Actor-Critic + PPO
├── scripts/train.py           # 训练入口
├── docs/LEARNING_GUIDE.md     # 长文教程
└── website/                   # 本多页教学站