AI、机器学习与深度学习
区分任务、模型与学习方法,建立全局框架。
学习系统需要连接三个决定:预测什么、如何表示输入,以及怎样根据样本改进预测。区分这些决定,才能具体说明 AI、机器学习与深度学习的关系。下文从预测任务出发,逐步明确哪些计算部分参与训练。
人工智能(AI)、机器学习与深度学习分别对应技术体系中的不同层次。人工智能是较广的研究领域;机器学习包含从数据中获得有用结构的方法;深度学习则是以多层神经网络为基础的一类机器学习方法。任务、模型族与优化方法应分别定义:分类规定输出要求,神经网络规定函数族,梯度下降规定参数更新方式。[1]
1. 作为优化问题的学习
监督学习数据集由输入与目标组成:
其中, 为样本数, 为输入维数。模型 给出预测 , 汇总可调整参数。给定与任务对应的损失函数 ,经验风险定义为:
训练的目标是降低这一目标函数,必要时加入正则项。经验风险衡量对已观察数据的拟合程度,泛化则关注所得模型在新样本上的表现。 [2]
2. 分类、回归与生成
任务类型取决于目标所代表的对象及其结构。[2]
| 任务 | 目标 | 一种表述 |
|---|---|---|
| 回归 | 实数值 | ,采用平方损失 |
| 分类 | 类别 | 类别概率 |
| 序列生成 | 词元序列 | 各后续词元的条件概率分布 |
回归中常用的损失为 ;分类中可采用目标类别的负对数似然 ;自回归序列模型则对目标词元的负对数概率求和。虽然这些计算最终都以数字实现,但其目标含义与预测要求并不相同。
训练方式属于另一层分类。监督学习使用给定目标,自监督学习则从数据自身构造目标,例如已观察序列中的下一个词元。因此,生成模型可以采用自监督训练;输出类型与目标构造方式并不是相互排斥的类别。
3. 固定表示与可学习表示
基于固定特征的模型可写为:
其中,表示 预先确定,预测参数 通过拟合获得。当表示本身可训练时,模型写为:
此时优化可以同时调整 与 。固定特征分类器已经在学习 ;表示学习进一步将 加入优化变量。两种写法用于分离学习流程中的这一具体变化。
多层表示可写为一系列复合变换:
其中, 为变换层数,矩阵与偏置具有相容形状, 为激活函数。深度描述函数的复合层次;表达能力是否增加,取决于具体变换。没有非线性介入时,多个仿射层的复合仍然是仿射映射。 [1]
4. 双样本回归例子
考虑构造样本 、 与模型 ,平均平方误差为:
由此得到 、,唯一最小值点为 。接下来的问题是这一拟合关系是否也适用于新样本,这正是第五篇引入评估过程的原因。
5. 模型与应用系统
训练后的函数 通常只是应用系统的一部分。输入预处理、检索、解码与输出处理都可能在不修改存储参数的情况下改变系统行为。因此,对模型架构的描述并不能完整说明应用如何产生答案。
数据、表示、模型、目标函数、优化过程与评估分布构成不同的分析对象。区分这些对象,有助于在统一框架下讨论传统学习方法、深度网络与语言模型。
参考文献
- 1: 《深度学习》导论
- 2: Google:什么是机器学习