Skip to content
2026-09-29 04:202754 字监督学习回归决策树SVMAdaBoost

机器学习基本概念 ​

机器学习是智能体从数据中自动学习知识的一种人工智能方法。其目标是从原始数据中提取特征,学习一个映射函数 将特征映射到语义空间,寻找数据和任务目标之间的关系。

机器学习的种类 ​

  • 监督学习:给定带标签信息的数据集 ,学习从输入 到输出 的映射。常用于回归(输出为连续值)和分类(输出为离散类别)。
  • 无监督学习:数据无标签,给定 ,目标是挖掘数据内在结构。常用于聚类和降维。
  • 强化学习:一种序列决策学习方法,智能体通过与环境的交互,根据奖励/惩罚来学习在不同状态下如何选择最优行动。

此外,介于监督学习和无监督学习之间还有半监督学习,它依赖于少量标注数据和大量未标注数据。

监督学习的基本概念 ​

监督学习从标注数据出发,学习一个映射函数 。模型的预测结果 与真实值 之间的差异由损失函数衡量,训练目标是使所有样本的“损失和”最小。

常见损失函数 ​

损失函数名称定义
0-1损失
平方损失
绝对损失
对数损失

风险与泛化 ​

  • 经验风险:模型在训练集上的平均损失。

  • 期望风险:模型在真实数据分布上的平均损失。

  • 目标:机器学习的目标是最小化期望风险,但现实中只能通过最小化经验风险来近似。

  • 结构风险最小化:为防止过拟合,在经验风险上加入表示模型复杂度的正则化项(惩罚项):

    • 为模型复杂度, 为惩罚系数,用于平衡经验风险与模型复杂度。
  • 模型泛化能力关系

经验风险期望风险泛化能力
小小强
小大过学习 (过拟合)
大大欠学习 (欠拟合)
大小“神仙算法”

判别方法与生成方法 ​

  • 判别方法:直接学习决策函数 或条件概率分布 。典型模型:回归、SVM、AdaBoost。
  • 生成方法:学习数据和类别的联合概率分布 ,再通过贝叶斯公式求取后验概率 。典型模型:贝叶斯方法、隐马尔可夫模型。

回归分析 ​

一元线性回归 ​

  • 核心思想:寻找一条直线,使得所有样本点到该直线的残差平方和(RSS) 最小。
  • 优化目标:
  • 求解方法(最小二乘法):分别对 和 求偏导并令其为0,解得参数。

多元线性回归 ​

  • 模型假设: (将 视为 的系数)
  • 优化目标:最小化均方误差
  • 闭式解:

逻辑斯蒂回归 (对数几率回归) ​

  • 模型:在线性回归基础上套上 Sigmoid 函数将输出压缩到 之间,产生概率意义。

  • Sigmoid 函数性质:单调递增,值域 , 时输出为 。

  • 损失函数:基于极大似然估计推导出对数损失函数 (交叉熵)。

  • 求解方法(梯度下降):通过迭代调整参数,沿梯度负方向寻找最小损失。 迭代公式: 求偏导并代入后得:

    • 为学习率。

决策树 ​

一种通过树形结构进行分类的方法。每个非叶子结点代表对一个属性的判断,每个分支代表一个判断结果,每个叶结点代表一种分类结果。

构建决策树 ​

纯度度量指标 ​

$$E(D) = -\sum_{k=1}^{K}p_k\log_2 p_k$$
  • 信息增益:使用某个属性 划分前后,信息熵减少的量。信息增益越大,意味着使用属性 划分所得到的“纯度提升”越大。

    缺点:偏向于选择取值数目较多的属性。

  • 信息增益率:对信息增益进行改进,对取值数目多的属性增加惩罚项。

  • 基尼系数:另一种衡量纯度的指标,计算更简便。

线性判别分析(LDA) ​

一种监督学习的降维方法。核心思想是,将数据投影到一个低维空间,使得同类样本尽可能靠近(类内方差小),不同类样本尽可能远离(类间间隔大)。

  • 二分类问题优化目标:
    • 为类间散度矩阵。
    • 为类内散度矩阵。
  • 求解:通过拉格朗日乘子法求解,得到最佳投影方向 。
  • 降维维度:LDA 降维后的维度最多为 。
  • 与 PCA 的区别:PCA 是无监督的,目标是让投影后方差最大;LDA 是有监督的,目标是让投影后类内聚合、类间分离。

AdaBoosting(自适应提升) ​

核心思想:将一个复杂的分类任务分解为若干个子任务,通过集成多个弱分类器(精度略高于随机猜测)来构建一个强分类器。

  • 理论基础:PAC (概率近似正确) 可学习理论,证明了强可学习与弱可学习是等价的。

Ada Boosting 算法 ​

  1. 初始化样本权重:每个样本的权重相等, 。
  2. 迭代训练 个弱分类器:
    • 训练:基于当前样本权重 训练一个弱分类器 。
    • 计算误差:
    • 计算权重:为当前分类器 计算在最终强分类器中的权重 。误差越小,权重越大。
    • 更新样本权重:增加被 错误分类的样本的权重,减小被正确分类样本的权重。
  3. 组合强分类器:
  • 本质:AdaBoost 算法是在以指数损失函数为优化目标,采用分步优化的方式,不断拟合前向阶梯模型的加法模型。

支持向量机(SVM) ​

核心思想:寻找一个超平面,使得其不仅能分开两类样本,而且分类间隔最大。基于结构风险最小化原则,旨在平衡经验风险和置信风险。

VC维与结构风险最小化 ​

  • VC维:衡量假设空间复杂度的指标。VC维越高,模型越复杂,置信风险越大。
  • 结构风险最小化:在保证分类精度(经验风险小)的同时,尽量增大分类间隔(从而降低VC维),以控制期望风险。

线性可分支持向量机 ​

  • 目标:最大化分类间隔 。
  • 优化问题:
  • 支持向量:距离超平面最近的,使 成立的样本点。最终模型只与支持向量有关。

松弛变量与软间隔 ​

  • 引入松弛变量 :表示第 个样本被分类错误所付出的代价。
  • 优化目标:
  • 为惩罚参数,用于平衡间隔最大化和误分类点个数。

核函数 ​

  • 核函数 :定义在原始空间中,其计算结果等于两个样本在某个高维特征空间中的内积,即 。
  • 这样,无需显式计算高维特征向量的 ,避免了“维数灾难”。
  • 常见核函数:线性核、多项式核、径向基函数(RBF)核、Sigmoid 核。

生成学习模型 ​

  • 核心公式:根据贝叶斯公式,后验概率 ,分类时选择后验概率最大的类别。
  • 关键思想:模型“学会”了数据是如何生成的,即学习到了似然概率 和先验概率 。
  • 典型模型:隐马尔可夫模型(HMM)、隐狄利克雷分布(LDA)。
  • 与判别式模型对比:
    • 判别模型:直接学习决策边界,渐近误差更小。
    • 生成模型:对数据分布的建模更充分,收敛到自身渐近误差的速度更快,在训练样本较少时可能表现更好。

小结 ​

监督学习从标注数据中学习从输入到输出的映射函数。本章介绍了多种经典模型:回归分析拟合变量关系;决策树通过树状规则分类;线性判别分析实现有监督的降维;Ada Boosting集成多个弱分类器;支持向量机寻找最大间隔超平面;生成模型则从概率角度建模数据分布。这些方法共同构成了监督学习的基础。

每一篇文章,都是时间的标本