知识框架
线性模型用参数的线性组合表达预测函数,是回归、分类和降维方法的基础。本章重点包括线性回归、岭回归、广义线性模型、多项式回归、线性判别函数、对数几率回归、交叉熵、LDA、多分类策略与 Softmax。
线性回归
对增广向量 $\tilde{\mathbf{x}}=(1,\mathbf{x}^\top)^\top$,线性模型可写为
\[
\hat y=\mathbf{w}^\top \tilde{\mathbf{x}}.
\]
最小二乘准则:
\[
J(\mathbf{w})=\frac{1}{2}\|\mathbf{X}\mathbf{w}-\mathbf{y}\|_2^2.
\]
若 $\mathbf{X}^\top\mathbf{X}$ 可逆,
\[
\mathbf{w}^{*}=(\mathbf{X}^\top\mathbf{X})^{-1}\mathbf{X}^\top\mathbf{y}.
\]
梯度下降更新:
\[
\mathbf{w}^{(t+1)}=\mathbf{w}^{(t)}-\eta \mathbf{X}^\top(\mathbf{X}\mathbf{w}^{(t)}-\mathbf{y}).
\]
一元线性回归手算
模型 $y=\beta_0+\beta_1 x+\epsilon$,最小二乘解:
\[
\hat\beta_1=\frac{\sum_i(x_i-\bar x)(y_i-\bar y)}{\sum_i(x_i-\bar x)^2},
\qquad
\hat\beta_0=\bar y-\hat\beta_1\bar x.
\]
手算题按四步:求均值、求分子协方差项、求分母方差项、代入截距。
正则化与岭回归
岭回归加入 $L_2$ 正则项:
\[
J_\lambda(\mathbf{w})=\frac{1}{2}\|\mathbf{X}\mathbf{w}-\mathbf{y}\|_2^2+\frac{\lambda}{2}\|\mathbf{w}\|_2^2.
\]
闭式解为
\[
\mathbf{w}^{*}=(\mathbf{X}^\top\mathbf{X}+\lambda \mathbf{I})^{-1}\mathbf{X}^\top\mathbf{y}.
\]
- 多重共线性会使普通最小二乘参数方差变大、估计不稳定。
- $\lambda=0$ 时退化为普通线性回归。
- $\lambda$ 过大时参数被压得很小,模型可能欠拟合。
- 岭回归可理解为高斯先验下的最大后验估计。
广义线性与多项式回归
广义线性模型使用联系函数把输出期望与线性预测值连接:
\[
g(\mathbb{E}[y\mid \mathbf{x}])=\mathbf{w}^\top\mathbf{x}+b.
\]
多项式回归把原始特征映射为 $\phi(\mathbf{x})$ 后再做线性回归:
\[
\hat y=\mathbf{w}^\top\phi(\mathbf{x}).
\]
它对参数仍是线性的,但对原始输入可以表达非线性关系;阶数过高时容易过拟合。
线性判别函数
二分类判别函数:
\[
d(\mathbf{x})=\mathbf{w}^\top\mathbf{x}+b,\qquad
\hat y=\operatorname{sign}(d(\mathbf{x})).
\]
多类分类可为每类设置判别函数 $d_k(\mathbf{x})$,选择最大者:
\[
\hat y=\arg\max_k d_k(\mathbf{x}).
\]
也可用 OvR 或 OvO 把多分类拆成多个二分类问题。
对数几率回归
Sigmoid 函数:
\[
\sigma(z)=\frac{1}{1+\exp(-z)},\qquad
p(y=1\mid \mathbf{x})=\sigma(\mathbf{w}^\top\mathbf{x}+b).
\]
二分类交叉熵:
\[
J(\mathbf{w})=-\sum_{i=1}^{m}\left[
y_i\log p_i+(1-y_i)\log(1-p_i)\right].
\]
它可由伯努利分布极大似然推导得到。预测时通常以 $p_i\ge 0.5$ 判为正类,也可根据任务调整阈值。
线性判别分析 LDA
LDA 希望投影后同类样本尽量紧凑、异类均值尽量分开。二分类中
\[
\mathbf{S}_w=\mathbf{S}_0+\mathbf{S}_1,
\]
\[
\mathbf{w}^{*}\propto \mathbf{S}_w^{-1}(\mathbf{\mu}_1-\mathbf{\mu}_0).
\]
其中 $\mathbf{S}_w$ 是类内散度矩阵,$\mathbf{\mu}_0,\mathbf{\mu}_1$ 是两类均值。LDA 既可用于分类,也可作为监督降维方法。
Softmax 多分类
多分类概率:
\[
p(y=k\mid \mathbf{x})=
\frac{\exp(z_k)}{\sum_{j=1}^{K}\exp(z_j)},\qquad z_k=\mathbf{w}_k^\top \mathbf{x}+b_k.
\]
多分类交叉熵:
\[
J=-\sum_{i=1}^{m}\sum_{k=1}^{K} y_{ik}\log p_{ik}.
\]
常见问法
- 给一组 $(x,y)$,用最小二乘法求截距和斜率。
- 解释岭回归如何缓解多重共线性,以及 $\lambda$ 取值对参数和泛化的影响。
- 写出线性回归的闭式解和梯度下降更新。
- 从极大似然角度解释线性回归或对数几率回归。
- 给判别函数,判断样本所属类别或画出二维决策边界。
- 给 Softmax 输出或神经网络前向计算,代入 Sigmoid/Softmax 得到概率。