AI 课程网站首页
返回知识库

AI、机器学习与深度学习

区分任务、模型与学习方法,建立全局框架。

本篇目录
  1. 作为优化问题的学习
  2. 分类、回归与生成
  3. 固定表示与可学习表示
  4. 双样本回归例子
  5. 模型与应用系统
  6. 参考文献

学习系统需要连接三个决定:预测什么、如何表示输入,以及怎样根据样本改进预测。区分这些决定,才能具体说明 AI、机器学习与深度学习的关系。下文从预测任务出发,逐步明确哪些计算部分参与训练。

人工智能(AI)、机器学习与深度学习分别对应技术体系中的不同层次。人工智能是较广的研究领域;机器学习包含从数据中获得有用结构的方法;深度学习则是以多层神经网络为基础的一类机器学习方法。任务、模型族与优化方法应分别定义:分类规定输出要求,神经网络规定函数族,梯度下降规定参数更新方式。[1]

1. 作为优化问题的学习

监督学习数据集由输入与目标组成:

D={(xi,yi)}i=1n,xi∈Rd\mathcal D=\{(x_i,y_i)\}_{i=1}^{n},\qquad x_i\in\mathbb R^d

其中,nn 为样本数,dd 为输入维数。模型 fθf_\theta 给出预测 y^i=fθ(xi)\hat y_i=f_\theta(x_i),θ\theta 汇总可调整参数。给定与任务对应的损失函数 ℓ(y^,y)\ell(\hat y,y),经验风险定义为:

R^D(θ)=1n∑i=1nℓ(fθ(xi),yi)\widehat R_{\mathcal D}(\theta) =\frac1n\sum_{i=1}^{n}\ell(f_\theta(x_i),y_i)

训练的目标是降低这一目标函数,必要时加入正则项。经验风险衡量对已观察数据的拟合程度,泛化则关注所得模型在新样本上的表现。 [2]

2. 分类、回归与生成

任务类型取决于目标所代表的对象及其结构。[2]

任务 目标 一种表述
回归 实数值 yy y^=w⊤x+b\hat y=w^\top x+b,采用平方损失
分类 类别 y∈{1,…,K}y\in\{1,\ldots,K\} 类别概率 pθ(k∣x)p_\theta(k\mid x)
序列生成 词元序列 各后续词元的条件概率分布

回归中常用的损失为 (y^−y)2(\hat y-y)^2;分类中可采用目标类别的负对数似然 −log⁡pθ(y∣x)-\log p_\theta(y\mid x);自回归序列模型则对目标词元的负对数概率求和。虽然这些计算最终都以数字实现,但其目标含义与预测要求并不相同。

训练方式属于另一层分类。监督学习使用给定目标,自监督学习则从数据自身构造目标,例如已观察序列中的下一个词元。因此,生成模型可以采用自监督训练;输出类型与目标构造方式并不是相互排斥的类别。

3. 固定表示与可学习表示

基于固定特征的模型可写为:

y^=gβ(ϕ(x))\hat y=g_\beta(\phi(x))

其中,表示 ϕ\phi 预先确定,预测参数 β\beta 通过拟合获得。当表示本身可训练时,模型写为:

y^=gβ(ϕα(x)),θ=(α,β)\hat y=g_\beta(\phi_\alpha(x)),\qquad \theta=(\alpha,\beta)

此时优化可以同时调整 α\alpha 与 β\beta。固定特征分类器已经在学习 β\beta;表示学习进一步将 α\alpha 加入优化变量。两种写法用于分离学习流程中的这一具体变化。

多层表示可写为一系列复合变换:

h(0)=x,h(l)=σl(Wlh(l−1)+bl),l=1,…,Lneth^{(0)}=x,\qquad h^{(l)}=\sigma_l(\mathbf{W}_lh^{(l-1)}+b_l),\quad l=1,\ldots,L_{\mathrm{net}}

其中,LnetL_{\mathrm{net}} 为变换层数,矩阵与偏置具有相容形状,σl\sigma_l 为激活函数。深度描述函数的复合层次;表达能力是否增加,取决于具体变换。没有非线性介入时,多个仿射层的复合仍然是仿射映射。 [1]

4. 双样本回归例子

考虑构造样本 (x,y)=(1,2)(x,y)=(1,2)、(2,4)(2,4) 与模型 fw(x)=wxf_w(x)=wx,平均平方误差为:

R^(w)=(w−2)2+(2w−4)22=52(w−2)2\widehat R(w) =\frac{(w-2)^2+(2w-4)^2}{2} =\frac52(w-2)^2

由此得到 R^(1)=2.5\widehat R(1)=2.5、R^(2)=0\widehat R(2)=0,唯一最小值点为 w=2w=2。接下来的问题是这一拟合关系是否也适用于新样本,这正是第五篇引入评估过程的原因。

5. 模型与应用系统

训练后的函数 fθf_\theta 通常只是应用系统的一部分。输入预处理、检索、解码与输出处理都可能在不修改存储参数的情况下改变系统行为。因此,对模型架构的描述并不能完整说明应用如何产生答案。

数据、表示、模型、目标函数、优化过程与评估分布构成不同的分析对象。区分这些对象,有助于在统一框架下讨论传统学习方法、深度网络与语言模型。

参考文献