知识框架
半监督学习利用少量有标记样本和大量未标记样本提升模型。本章重点包括未标记样本的假设、纯半监督与直推学习、生成式方法、半监督 SVM、图半监督学习、基于分歧的方法、半监督聚类。
未标记样本与基本假设
未标记样本本身没有类别信息,但能揭示数据分布结构。常见假设:
- 平滑假设
- 相近样本应有相近输出。
- 聚类假设
- 同一簇内样本倾向于同类,决策边界应穿过低密度区域。
- 流形假设
- 高维数据分布在低维流形上,流形上相近样本输出相似。
纯半监督学习关注对未来样本泛化;直推学习重点预测给定未标记样本的标记。
生成式半监督方法
生成式方法假定数据由某个概率模型生成,例如每个类别对应一个混合成分。设有标记集 $L$ 和未标记集 $U$,目标函数通常包含:
\[
\log P(L,U\mid \theta)
=
\log P(L\mid \theta)+\log P(U\mid \theta).
\]
未标记样本类别可视为隐变量,用 EM 迭代:
- E 步:用当前参数估计未标记样本属于各类别的后验概率。
- M 步:结合有标记样本和未标记样本软标记更新模型参数。
半监督 SVM
TSVM 希望分类超平面穿过低密度区域。形式上,未标记样本的类别也参与优化:
\[
\min_{\mathbf{w},b,\mathbf{\xi},\hat{\mathbf{y}}}
\frac{1}{2}\|\mathbf{w}\|^2
+C_l\sum_{i\in L}\xi_i
+C_u\sum_{j\in U}\xi_j.
\]
其中 $\hat y_j$ 是未标记样本的预测标记。由于标记组合离散且复杂,实际常用局部搜索和标签交换近似求解。
图半监督学习
把样本看成图中结点,边权 $w_{ij}$ 表示相似度。图上的平滑正则项为
\[
\frac{1}{2}\sum_{i,j}w_{ij}(f_i-f_j)^2
=\mathbf{f}^\top\mathbf{L}\mathbf{f},
\]
其中 $\mathbf{L}$ 是图拉普拉斯矩阵。标记传播的直观思想:有标记结点把标记信息沿高相似度边传播给未标记结点。
常见迭代形式:
\[
\mathbf{F}^{(t+1)}=\alpha \mathbf{S}\mathbf{F}^{(t)}+(1-\alpha)\mathbf{Y},
\]
其中 $\mathbf{S}$ 是归一化相似矩阵,$\mathbf{Y}$ 是初始标记矩阵。
基于分歧的方法
协同训练要求数据有两个充分且条件独立的视图。流程:
- 用两个视图分别训练两个分类器。
- 每个分类器从未标记样本中挑选高置信预测。
- 把这些伪标记样本加入另一个分类器的训练集。
- 重复迭代。
核心是让不同学习器互相提供信息,同时保持一定分歧。
半监督聚类
监督信息可以是:
- 成对约束:must-link 表示两个样本必须同簇,cannot-link 表示不能同簇。
- 少量有标记样本:作为种子引导聚类。
约束 k-means 在分配样本时必须满足约束;种子 k-means 用有标记样本初始化或约束簇中心。
常见问法
- 解释半监督学习为什么能利用未标记样本。
- 比较纯半监督学习、直推学习和主动学习。
- 写出生成式半监督方法的 EM 思路。
- 说明 TSVM 为什么倾向于把边界放在低密度区域。
- 给图结构,解释标签传播或图正则化的目标。
- 比较协同训练、图半监督学习和半监督聚类的适用条件。