知识框架

线性模型用参数的线性组合表达预测函数,是回归、分类和降维方法的基础。本章重点包括线性回归、岭回归、广义线性模型、多项式回归、线性判别函数、对数几率回归、交叉熵、LDA、多分类策略与 Softmax。

线性回归

对增广向量 $\tilde{\mathbf{x}}=(1,\mathbf{x}^\top)^\top$,线性模型可写为

\[ \hat y=\mathbf{w}^\top \tilde{\mathbf{x}}. \]

最小二乘准则:

\[ J(\mathbf{w})=\frac{1}{2}\|\mathbf{X}\mathbf{w}-\mathbf{y}\|_2^2. \]

若 $\mathbf{X}^\top\mathbf{X}$ 可逆,

\[ \mathbf{w}^{*}=(\mathbf{X}^\top\mathbf{X})^{-1}\mathbf{X}^\top\mathbf{y}. \]

梯度下降更新:

\[ \mathbf{w}^{(t+1)}=\mathbf{w}^{(t)}-\eta \mathbf{X}^\top(\mathbf{X}\mathbf{w}^{(t)}-\mathbf{y}). \]

一元线性回归手算

模型 $y=\beta_0+\beta_1 x+\epsilon$,最小二乘解:

\[ \hat\beta_1=\frac{\sum_i(x_i-\bar x)(y_i-\bar y)}{\sum_i(x_i-\bar x)^2}, \qquad \hat\beta_0=\bar y-\hat\beta_1\bar x. \]

手算题按四步:求均值、求分子协方差项、求分母方差项、代入截距。

正则化与岭回归

岭回归加入 $L_2$ 正则项:

\[ J_\lambda(\mathbf{w})=\frac{1}{2}\|\mathbf{X}\mathbf{w}-\mathbf{y}\|_2^2+\frac{\lambda}{2}\|\mathbf{w}\|_2^2. \]

闭式解为

\[ \mathbf{w}^{*}=(\mathbf{X}^\top\mathbf{X}+\lambda \mathbf{I})^{-1}\mathbf{X}^\top\mathbf{y}. \]
  • 多重共线性会使普通最小二乘参数方差变大、估计不稳定。
  • $\lambda=0$ 时退化为普通线性回归。
  • $\lambda$ 过大时参数被压得很小,模型可能欠拟合。
  • 岭回归可理解为高斯先验下的最大后验估计。

广义线性与多项式回归

广义线性模型使用联系函数把输出期望与线性预测值连接:

\[ g(\mathbb{E}[y\mid \mathbf{x}])=\mathbf{w}^\top\mathbf{x}+b. \]

多项式回归把原始特征映射为 $\phi(\mathbf{x})$ 后再做线性回归:

\[ \hat y=\mathbf{w}^\top\phi(\mathbf{x}). \]

它对参数仍是线性的,但对原始输入可以表达非线性关系;阶数过高时容易过拟合。

线性判别函数

二分类判别函数:

\[ d(\mathbf{x})=\mathbf{w}^\top\mathbf{x}+b,\qquad \hat y=\operatorname{sign}(d(\mathbf{x})). \]

多类分类可为每类设置判别函数 $d_k(\mathbf{x})$,选择最大者:

\[ \hat y=\arg\max_k d_k(\mathbf{x}). \]

也可用 OvR 或 OvO 把多分类拆成多个二分类问题。

对数几率回归

Sigmoid 函数:

\[ \sigma(z)=\frac{1}{1+\exp(-z)},\qquad p(y=1\mid \mathbf{x})=\sigma(\mathbf{w}^\top\mathbf{x}+b). \]

二分类交叉熵:

\[ J(\mathbf{w})=-\sum_{i=1}^{m}\left[ y_i\log p_i+(1-y_i)\log(1-p_i)\right]. \]

它可由伯努利分布极大似然推导得到。预测时通常以 $p_i\ge 0.5$ 判为正类,也可根据任务调整阈值。

线性判别分析 LDA

LDA 希望投影后同类样本尽量紧凑、异类均值尽量分开。二分类中

\[ \mathbf{S}_w=\mathbf{S}_0+\mathbf{S}_1, \]
\[ \mathbf{w}^{*}\propto \mathbf{S}_w^{-1}(\mathbf{\mu}_1-\mathbf{\mu}_0). \]

其中 $\mathbf{S}_w$ 是类内散度矩阵,$\mathbf{\mu}_0,\mathbf{\mu}_1$ 是两类均值。LDA 既可用于分类,也可作为监督降维方法。

Softmax 多分类

多分类概率:

\[ p(y=k\mid \mathbf{x})= \frac{\exp(z_k)}{\sum_{j=1}^{K}\exp(z_j)},\qquad z_k=\mathbf{w}_k^\top \mathbf{x}+b_k. \]

多分类交叉熵:

\[ J=-\sum_{i=1}^{m}\sum_{k=1}^{K} y_{ik}\log p_{ik}. \]

常见问法

  1. 给一组 $(x,y)$,用最小二乘法求截距和斜率。
  2. 解释岭回归如何缓解多重共线性,以及 $\lambda$ 取值对参数和泛化的影响。
  3. 写出线性回归的闭式解和梯度下降更新。
  4. 从极大似然角度解释线性回归或对数几率回归。
  5. 给判别函数,判断样本所属类别或画出二维决策边界。
  6. 给 Softmax 输出或神经网络前向计算,代入 Sigmoid/Softmax 得到概率。