AI 课程网站首页
返回知识库

升维、非线性变换与投影

通过更宽的中间层构造非线性函数。

本篇目录
  1. MLP 中的升维与投影
  2. 二维、四维、二维的精确构造
  3. 表达能力与局部秩
  4. 与 Transformer 前馈层的联系
  5. 计算成本与收益
  6. 参考文献

更宽的隐藏层可以对同一输入计算多组响应,再将它们组合为紧凑输出。例如,分别保留正数和负数对应的响应,再进行组合,就能得到绝对值。这个简单构造足以解释升维的作用,无需先引入 Transformer。

扩张隐藏层为中间非线性变换提供更多坐标,同时保持规定的输入输出宽度。其作用取决于这些坐标如何被激活和重新组合,而不是仅取决于坐标数量增加。

1. MLP 中的升维与投影

对于列向量输入 x∈Rdx\in\mathbb R^d,取中间宽度 m>dm>d,两层多层感知机(MLP)可写为:

h=ReLU⁡(Ax+a),y=Bh+bh=\operatorname{ReLU}(Ax+a),\qquad y=Bh+b

其中:

A∈Rm×d,a∈Rm,B∈Rd×m,b∈RdA\in\mathbb R^{m\times d},\quad a\in\mathbb R^m,\quad B\in\mathbb R^{d\times m},\quad b\in\mathbb R^d

ReLU 按坐标作用,定义为 ReLU⁡(t)=max⁡(0,t)\operatorname{ReLU}(t)=\max(0,t)。隐藏表示具有 mm 个坐标,输出恢复为 dd 个坐标。这里的“投影”指可学习的线性映射,不要求是正交投影。计入两组偏置后,参数量为 2dm+m+d2dm+m+d。[1]

去掉激活函数后,整个函数变为 y=BAx+Ba+by=BAx+Ba+b,仍然只是一个仿射映射。因此,升维本身并不能证明非线性函数族扩大;在这里讨论的构造中,激活函数具有关键作用。

2. 二维、四维、二维的精确构造

取零偏置与矩阵:

A=(10−10010−1),B=(11000011)A=\begin{pmatrix}1&0\\-1&0\\0&1\\0&-1\end{pmatrix},\qquad B=\begin{pmatrix}1&1&0&0\\0&0&1&1\end{pmatrix}

隐藏向量及输出为:

h=(max⁡(0,x1)max⁡(0,−x1)max⁡(0,x2)max⁡(0,−x2)),y=(∣x1∣∣x2∣)h=\begin{pmatrix}\max(0,x_1)\\\max(0,-x_1)\\\max(0,x_2)\\\max(0,-x_2)\end{pmatrix},\qquad y=\begin{pmatrix}|x_1|\\|x_2|\end{pmatrix}

对于每个输入坐标,一个隐藏单元保留其正部分,另一个保留其相反数的正部分,两者相加得到绝对值。取 x=(−2,3)⊤x=(-2,3)^\top,计算为:

Ax=(−2,2,3,−3)⊤,h=(0,2,3,0)⊤,y=(2,3)⊤Ax=(-2,2,3,-3)^\top,\quad h=(0,2,3,0)^\top,\quad y=(2,3)^\top

该架构具有 16 个矩阵元素和六个偏置位置。上述显式构造将所有偏置设为零,并直接指定矩阵数值。

若移除 ReLU,则 BA=0BA=0,所有输入都会输出零。因此,非线性激活对函数的改变可以直接验证。

3. 表达能力与局部秩

单个仿射函数 at+cat+c 不可能在整个实数域上表示 ∣t∣|t|。零点和一点分别要求 c=0c=0、a=1a=1,而负一点又要求 a=−1a=-1,产生矛盾。

在 ReLU 激活符号固定的区域内,MLP 为仿射函数。避开激活前数值等于零的位置,其雅可比矩阵为:

Jy(x)=B diag⁡ ⁣(1[Ax+a>0])AJ_y(x)=B\,\operatorname{diag}\!\left(\mathbf1[Ax+a>0]\right)A

对角元素选择激活单元,跨过激活边界时,局部仿射映射可能改变。更大的 mm 提供更多中间单元,供训练形成有用的激活模式。

雅可比矩阵的秩仍然不超过 dd。从同一输入计算更多坐标,并不会产生新的独立观测。在上述构造中,x1=h1−h2x_1=h_1-h_2、x2=h3−h4x_2=h_3-h_4,因此隐藏表示保留原输入;最终求和则丢弃符号。信息保留取决于具体映射,不能仅根据“升维”或“投影”的名称判断。 [1]

4. 与 Transformer 前馈层的联系

原始 Transformer 的逐位置前馈网络采用“扩展、激活、投影”结构。同一个函数以共享参数分别作用于各序列位置;这与跨位置组合表示的注意力不同。[2]

对于原始配置 d=512d=512、m=2048m=2048,计入偏置的参数量为:

2⋅512⋅2048+2048+512=20997122\cdot512\cdot2048+2048+512=2099712

这一统计只包含前馈层。原始的四倍宽度属于一种设计选择,其局部机制是扩展、非线性激活,再投影回所需输出宽度。

5. 计算成本与收益

增加 mm 会提高隐藏激活值的存储需求,以及矩阵乘法的运算成本。相应地,模块可以构造并组合更多非线性的中间响应,同时让输出形状保持与周围层相容。

这种成本是否值得,需要结合任务、优化过程与留出评估判断。宽度或参数量本身都不能确定准确率。因此,先升维再投影应被理解为具有明确成本的结构化非线性计算,而不是增加或减少信息的通用规则。 [1]

参考文献