知识框架
强化学习研究智能体与环境交互中的序贯决策问题。重点包括 MDP、策略、奖赏、回报、价值函数、K-摇臂赌博机、有模型学习、策略迭代、价值迭代、蒙特卡罗、Sarsa、Q-learning、值函数近似、模仿学习和 RLHF。
基本设置与 MDP
强化学习常用马尔可夫决策过程描述。基本四元组为
\[
(\mathcal{S},\mathcal{A},P,R),
\]
实际问题中通常还给定折扣因子 $\gamma$。
- $\mathcal{S}$
- 状态空间,描述环境当前情况。
- $\mathcal{A}$
- 动作空间,智能体可选择的行为。
- $P(s'\mid s,a)$
- 状态转移概率。
- $R(s,a,s')$
- 奖赏函数,定义动作后即时反馈。
- $\gamma$
- 折扣因子,权衡近期和长期奖赏。
策略 $\pi(a\mid s)$ 描述在状态 $s$ 下选择动作 $a$ 的概率。目标是最大化期望累计回报:
\[
G_t=\sum_{k=0}^{\infty}\gamma^k R_{t+k+1}.
\]
价值函数
状态价值函数:
\[
V^\pi(s)=\mathbb{E}_\pi[G_t\mid S_t=s].
\]
动作价值函数:
\[
Q^\pi(s,a)=\mathbb{E}_\pi[G_t\mid S_t=s,A_t=a].
\]
Bellman 期望方程:
\[
V^\pi(s)=\sum_a\pi(a\mid s)\sum_{s'}P(s'\mid s,a)
\left[R(s,a,s')+\gamma V^\pi(s')\right].
\]
最优价值满足
\[
V^{*}(s)=\max_a\sum_{s'}P(s'\mid s,a)
\left[R(s,a,s')+\gamma V^{*}(s')\right].
\]
K-摇臂赌博机
赌博机问题只有动作选择,没有状态转移。$\epsilon$-贪心策略:
- 以 $1-\epsilon$ 概率选择当前估计最优动作。
- 以 $\epsilon$ 概率随机探索。
增量式动作价值估计:
\[
Q_{n+1}=Q_n+\alpha(R_n-Q_n).
\]
有模型学习
若已知 $P$ 和 $R$,可做动态规划。
策略迭代
- 策略评估:计算当前策略 $\pi$ 的 $V^\pi$。
- 策略改进:令
- 重复直到策略稳定。
\[
\pi'(s)=\arg\max_a\sum_{s'}P(s'\mid s,a)
\left[R(s,a,s')+\gamma V^\pi(s')\right].
\]
价值迭代
\[
V_{k+1}(s)=\max_a\sum_{s'}P(s'\mid s,a)
\left[R(s,a,s')+\gamma V_k(s')\right].
\]
价值迭代把策略评估和策略改进合在一起,常用于手算小型 MDP。
免模型学习
无模型时通过采样经验更新价值。
蒙特卡罗
用完整回合的实际回报估计价值,优点是不需要转移模型,缺点是需要等回合结束,方差较大。
Sarsa
同策略时序差分更新:
\[
Q(s,a)\leftarrow Q(s,a)+\alpha
\left[r+\gamma Q(s',a')-Q(s,a)\right].
\]
其中 $a'$ 是当前策略在下一状态实际选择的动作。
Q-learning
异策略更新:
\[
Q(s,a)\leftarrow Q(s,a)+\alpha
\left[r+\gamma\max_{a'}Q(s',a')-Q(s,a)\right].
\]
它学习贪心目标策略,但行为策略仍可探索。
值函数近似、模仿学习与 RLHF
连续或巨大状态空间中不能为每个状态存表,可用函数近似:
\[
Q(s,a;\mathbf{w})=\mathbf{w}^\top\phi(s,a).
\]
模仿学习从专家示范中学习行为,适合奖赏难设计或探索代价高的任务。逆强化学习从专家行为反推奖赏函数。
RLHF 通常包括:监督微调、训练奖励模型、用强化学习优化策略。其核心是把人类偏好转化为奖励信号,使模型输出更符合偏好。
强化学习与监督学习对比
- 监督学习有直接标签;强化学习通常只有延迟奖赏。
- 监督学习样本多假设独立同分布;强化学习数据由策略与环境交互产生。
- 监督学习关注单步预测;强化学习关注多步决策和长期收益。
- 强化学习需要处理探索与利用的权衡。
常见问法
- 列出 MDP 四元组并解释每个元素作用。
- 说明强化学习目标,以及与监督学习的区别。
- 给小型 MDP,按价值迭代公式计算 $V_1,V_2$。
- 根据价值函数做策略改进,判断策略是否变化。
- 比较策略迭代和价值迭代。
- 写出 Sarsa 和 Q-learning 更新式,并说明同策略与异策略差异。
- 解释 $\epsilon$-贪心中的探索和利用。