MDP 基础¶
强化学习把序贯决策写成马尔可夫决策过程(MDP)。
五元组¶
[ M = (S, A, P, R, \gamma) ]
| 符号 | 含义 |
|---|---|
| (S) | 状态空间 |
| (A) | 动作空间 |
| (P) | 转移 (P(s'\mid s,a)) |
| (R) | 奖励 (r(s,a,s')) 或 (r(s,a)) |
| (\gamma) | 折扣因子 (\in [0,1)) |
Agent–环境循环¶
- 观测 (s_t)
- 按策略 (\pi(a_t \mid s_t)) 选动作
- 环境给出 (s_{t+1},\, r_t)
- 目标:最大化期望折扣回报
倒立摆中的实例¶
在 Cart-Pole 平衡任务中:
- (s = [x,\dot x,\theta,\dot\theta])
- (a \in [-1,1]),力 (F = 10a)(N)
- 终止:(|x|>2.4) 或 (|\theta|>12^\circ)
完整建模与代码对照见教学站:MDP 建模。