1. MDP 形式化
把「小车推杆」写成 (S, A, P, R, γ),搞清状态、动作、终止条件与奖励设计。
进入 MDP →用完整的马尔可夫决策过程(MDP)建模,配合 Genesis 物理引擎与手写 PPO, 从零学会「观测 → 决策 → 奖励 → 更新策略」的闭环。
RL_Demo/
├── assets/cart_pole.urdf # 小车-摆杆 URDF
├── configs/train_config.yaml # 超参
├── src/mdp/ # MDP 定义与奖励
├── src/envs/ # Genesis / 分析动力学环境
├── src/ppo/ # 手写 Actor-Critic + PPO
├── scripts/train.py # 训练入口
├── docs/LEARNING_GUIDE.md # 长文教程
└── website/ # 本多页教学站