跳转至

MDP 基础

强化学习把序贯决策写成马尔可夫决策过程(MDP)。

五元组

[ M = (S, A, P, R, \gamma) ]

符号 含义
(S) 状态空间
(A) 动作空间
(P) 转移 (P(s'\mid s,a))
(R) 奖励 (r(s,a,s')) 或 (r(s,a))
(\gamma) 折扣因子 (\in [0,1))

Agent–环境循环

  1. 观测 (s_t)
  2. 按策略 (\pi(a_t \mid s_t)) 选动作
  3. 环境给出 (s_{t+1},\, r_t)
  4. 目标:最大化期望折扣回报

倒立摆中的实例

在 Cart-Pole 平衡任务中:

  • (s = [x,\dot x,\theta,\dot\theta])
  • (a \in [-1,1]),力 (F = 10a)(N)
  • 终止:(|x|>2.4) 或 (|\theta|>12^\circ)

完整建模与代码对照见教学站:MDP 建模