知识框架
- 机器学习关注从经验数据中获得规律,并把学到的模型用于新样本预测、分类、聚类、特征提取或数据生成。
- 模式识别强调从样本中提取模式并判定类别;机器学习强调通过训练数据自动得到处理任务的规则;人工智能是更大的目标系统。
- 典型任务包括分类、回归、聚类、降维、异常检测、生成建模和强化学习。
- 机器学习三要素:模型、策略、算法。模型给出假设空间,策略定义好坏,算法负责求解。
核心概念
样本、标记与数据集
样本通常写作特征向量
\[
\mathbf{x}_i=(x_{i1},x_{i2},\ldots,x_{id})^\top,\qquad y_i\in \mathcal{Y}.
\]
数据集写作
\[
D=\{(\mathbf{x}_1,y_1),(\mathbf{x}_2,y_2),\ldots,(\mathbf{x}_m,y_m)\}.
\]
样本空间为 $\mathcal{X}$,标记空间为 $\mathcal{Y}$。多分类标记常用 one-hot 编码,例如三分类第2类可写成 $(0,1,0)$。
假设空间与学习器
学习算法 $A$ 在假设空间 $\mathcal{H}$ 中搜索模型 $g$,希望 $g$ 接近真实目标 $f$。训练集误差小不等于泛化能力强,最终关心的是新样本上的表现。
损失函数、代价函数与泛化
- 单样本损失:$\ell(y,\hat y)$,度量某个样本预测错误程度。
- 数据集代价:$J(g)=\frac{1}{m}\sum_{i=1}^{m}\ell(y_i,g(\mathbf{x}_i))$。
- 常见损失:$0$-$1$ 损失、平方损失、绝对损失、交叉熵损失。
- 泛化能力:模型对未见样本的适应能力。
学习范式
- 监督学习
- 训练数据含标记,目标是学习 $\mathbf{x}\mapsto y$。分类和回归都属于监督学习。
- 无监督学习
- 训练数据无标记,目标是发现数据结构,如聚类、降维、异常检测。
- 半监督学习
- 少量标记样本结合大量未标记样本,依赖平滑假设、聚类假设或流形假设。
- 强化学习
- 智能体与环境交互,通过奖赏信号学习策略,关注长期累计收益。
- 基于实例的学习
- 训练阶段主要存储样本,预测时比较新样本与已有样本,如 kNN。
- 基于模型的学习
- 训练阶段显式拟合参数化或非参数模型,如线性回归、SVM、神经网络。
- 生成式模型
- 学习 $P(\mathbf{x},y)$ 或 $P(\mathbf{x}\mid y)P(y)$,再由贝叶斯公式分类。
- 判别式模型
- 直接学习 $P(y\mid \mathbf{x})$ 或决策边界。
建模流程
- 明确任务:分类、回归、聚类、排序、生成或决策。
- 收集并理解数据:样本量、特征类型、标记质量、类别分布。
- 数据预处理:缺失值、异常值、归一化、编码、去噪。
- 特征工程或表示学习:选择、构造、降维或学习特征。
- 划分训练集、验证集、测试集,必要时采用交叉验证。
- 选择模型与损失函数,训练参数,调节超参数。
- 用合适指标评估模型,并分析欠拟合、过拟合、数据偏差。
- 部署后监测数据分布漂移与性能变化。
常见问法
- 比较监督学习、无监督学习、半监督学习和强化学习,并各举一个例子。
- 给定一个业务场景,写出机器学习建模主要步骤。
- 区分分类、回归、聚类、异常检测和生成任务。
- 解释模型、策略、算法三要素,以及损失函数和泛化能力的关系。
- 比较生成式模型与判别式模型:生成式先建模数据产生机制,判别式直接建模决策边界。
易错点
- 分类输出离散类别,回归输出连续数值;二者都可以是监督学习。
- 聚类不是分类:聚类没有真实类别标记参与训练。
- 训练误差低只能说明模型适合训练数据,不必然说明泛化能力强。
- 特征质量对模型上限影响很大,“Garbage in, garbage out” 是建模中的基本警示。