知识框架

强化学习研究智能体与环境交互中的序贯决策问题。重点包括 MDP、策略、奖赏、回报、价值函数、K-摇臂赌博机、有模型学习、策略迭代、价值迭代、蒙特卡罗、Sarsa、Q-learning、值函数近似、模仿学习和 RLHF。

基本设置与 MDP

强化学习常用马尔可夫决策过程描述。基本四元组为

\[ (\mathcal{S},\mathcal{A},P,R), \]

实际问题中通常还给定折扣因子 $\gamma$。

$\mathcal{S}$
状态空间,描述环境当前情况。
$\mathcal{A}$
动作空间,智能体可选择的行为。
$P(s'\mid s,a)$
状态转移概率。
$R(s,a,s')$
奖赏函数,定义动作后即时反馈。
$\gamma$
折扣因子,权衡近期和长期奖赏。

策略 $\pi(a\mid s)$ 描述在状态 $s$ 下选择动作 $a$ 的概率。目标是最大化期望累计回报:

\[ G_t=\sum_{k=0}^{\infty}\gamma^k R_{t+k+1}. \]

价值函数

状态价值函数:

\[ V^\pi(s)=\mathbb{E}_\pi[G_t\mid S_t=s]. \]

动作价值函数:

\[ Q^\pi(s,a)=\mathbb{E}_\pi[G_t\mid S_t=s,A_t=a]. \]

Bellman 期望方程:

\[ V^\pi(s)=\sum_a\pi(a\mid s)\sum_{s'}P(s'\mid s,a) \left[R(s,a,s')+\gamma V^\pi(s')\right]. \]

最优价值满足

\[ V^{*}(s)=\max_a\sum_{s'}P(s'\mid s,a) \left[R(s,a,s')+\gamma V^{*}(s')\right]. \]

K-摇臂赌博机

赌博机问题只有动作选择,没有状态转移。$\epsilon$-贪心策略:

  • 以 $1-\epsilon$ 概率选择当前估计最优动作。
  • 以 $\epsilon$ 概率随机探索。

增量式动作价值估计:

\[ Q_{n+1}=Q_n+\alpha(R_n-Q_n). \]

有模型学习

若已知 $P$ 和 $R$,可做动态规划。

策略迭代

  1. 策略评估:计算当前策略 $\pi$ 的 $V^\pi$。
  2. 策略改进:令
  3. \[ \pi'(s)=\arg\max_a\sum_{s'}P(s'\mid s,a) \left[R(s,a,s')+\gamma V^\pi(s')\right]. \]
  4. 重复直到策略稳定。

价值迭代

\[ V_{k+1}(s)=\max_a\sum_{s'}P(s'\mid s,a) \left[R(s,a,s')+\gamma V_k(s')\right]. \]

价值迭代把策略评估和策略改进合在一起,常用于手算小型 MDP。

免模型学习

无模型时通过采样经验更新价值。

蒙特卡罗

用完整回合的实际回报估计价值,优点是不需要转移模型,缺点是需要等回合结束,方差较大。

Sarsa

同策略时序差分更新:

\[ Q(s,a)\leftarrow Q(s,a)+\alpha \left[r+\gamma Q(s',a')-Q(s,a)\right]. \]

其中 $a'$ 是当前策略在下一状态实际选择的动作。

Q-learning

异策略更新:

\[ Q(s,a)\leftarrow Q(s,a)+\alpha \left[r+\gamma\max_{a'}Q(s',a')-Q(s,a)\right]. \]

它学习贪心目标策略,但行为策略仍可探索。

值函数近似、模仿学习与 RLHF

连续或巨大状态空间中不能为每个状态存表,可用函数近似:

\[ Q(s,a;\mathbf{w})=\mathbf{w}^\top\phi(s,a). \]

模仿学习从专家示范中学习行为,适合奖赏难设计或探索代价高的任务。逆强化学习从专家行为反推奖赏函数。

RLHF 通常包括:监督微调、训练奖励模型、用强化学习优化策略。其核心是把人类偏好转化为奖励信号,使模型输出更符合偏好。

强化学习与监督学习对比

  • 监督学习有直接标签;强化学习通常只有延迟奖赏。
  • 监督学习样本多假设独立同分布;强化学习数据由策略与环境交互产生。
  • 监督学习关注单步预测;强化学习关注多步决策和长期收益。
  • 强化学习需要处理探索与利用的权衡。

常见问法

  1. 列出 MDP 四元组并解释每个元素作用。
  2. 说明强化学习目标,以及与监督学习的区别。
  3. 给小型 MDP,按价值迭代公式计算 $V_1,V_2$。
  4. 根据价值函数做策略改进,判断策略是否变化。
  5. 比较策略迭代和价值迭代。
  6. 写出 Sarsa 和 Q-learning 更新式,并说明同策略与异策略差异。
  7. 解释 $\epsilon$-贪心中的探索和利用。