AI 课程网站首页
返回知识库

非线性、深度与残差连接

分析非线性、网络深度与残差路径的作用。

本篇目录
  1. 仿射层的复合
  2. 非线性与分段仿射函数
  3. 残差块
  4. 导数与形状匹配
  5. 深度、宽度与评估
  6. 参考文献

增加网络层的价值在于,通过复合变换表达简单模型难以处理的关系。非线性使模型在不同输入区域具有不同响应,残差路径则让分支学习对已有表示的修正。这两个机制比单独的层数更能说明网络结构的作用。

网络深度、非线性激活与残差相加影响模型的不同性质。分析其作用,需要检查所表示的函数及其导数,而不能仅根据层数判断模型能力。

1. 仿射层的复合

考虑两个形状相容的仿射层:

h=W1x+b1,y=W2h+b2h=\mathbf{W}_1x+b_1,\qquad y=\mathbf{W}_2h+b_2

代入后得到:

y=(W2W1)x+(W2b1+b2)y=(\mathbf{W}_2\mathbf{W}_1)x+(\mathbf{W}_2b_1+b_2)

因此,这一复合在函数意义上等价于单个仿射映射。对仅包含仿射变换的有限层结构,可以递归应用同一结论。不过,不同参数分解仍可能改变优化行为,因此函数等价并不意味着训练动态相同。[1]

例如,标量层 h=2x+1h=2x+1 与 y=3h−2y=3h-2 的复合为 y=6x+1y=6x+1。仅增加这类层的数量,不会引入非线性的输入输出关系。

2. 非线性与分段仿射函数

插入 ReLU⁡(z)=max⁡(0,z)\operatorname{ReLU}(z)=\max(0,z) 后,得到:

f(x)=3ReLU⁡(2x+1)−2={−2,x≤−1/2,6x+1,x>−1/2f(x)=3\operatorname{ReLU}(2x+1)-2 =\begin{cases} -2,&x\le-1/2,\\ 6x+1,&x>-1/2 \end{cases}

两个区域具有不同斜率,因此不能在整个实数域上用一个仿射表达式替代。直接代入可得 f(−1)=−2f(-1)=-2、f(0)=1f(0)=1、f(1)=7f(1)=7。

对于一般 ReLU 网络,固定各层激活单元后,可将激活函数替换为零和一组成的对角掩码。在对应区域内,网络为仿射函数;跨过激活边界,则可能切换到另一个仿射映射。区域之间的变化由此形成非线性行为。 [1]

3. 残差块

输入输出宽度相同的残差块定义为:

y=x+Fθ(x),x,y∈Rdy=x+F_\theta(x),\qquad x,y\in\mathbb R^d

直接路径传递 xx,可训练分支表示加性修正。对于目标映射 H(x)H(x),相应修正可写为 H(x)−xH(x)-x。在保留输入有用的情况下,分支无需独立重建完整的恒等映射。[2]

取 x=(2,−1)⊤x=(2,-1)^\top、Fθ(x)=(0.5,0.25)⊤F_\theta(x)=(0.5,0.25)^\top,输出为 (2.5,−0.75)⊤(2.5,-0.75)^\top。当分支输出为零时,模块保留 xx,使恒等映射成为一个特别简单的情形。

4. 导数与形状匹配

在可微位置,记 JF=∂F/∂xJ_F=\partial F/\partial x,输入雅可比矩阵与损失梯度为:

Jy=I+JF,∇xL=(I+JF)⊤∇yLJ_y=I+J_F,\qquad \nabla_x\mathcal L=(I+J_F)^\top\nabla_y\mathcal L

恒等项提供直接的梯度路径,但仍可能发生抵消:当 F(x)=−xF(x)=-x 时,输出与雅可比矩阵同时为零。这个反例明确了直接梯度路径论证的适用边界。

当输入输出宽度不同时,可采用投影快捷路径:

y=Px+Fθ(x),P∈Rdout×diny=Px+F_\theta(x),\qquad P\in\mathbb R^{d_{\rm out}\times d_{\rm in}}

相加前,两条分支必须产生相同形状。投影 PP 不再是等维空间中的恒等映射,其影响需要纳入模块分析。拼接则是另一种操作:它连接坐标,而不是将对应元素相加。 [2]

5. 深度、宽度与评估

深度计量顺序变换阶段,宽度计量某个阶段的分量数量。修改两者都可能改变函数族、计算成本与优化问题;初始化、归一化和学习率仍会影响训练能否找到有用参数。

因此,应区分三个判断:架构能否表示某个函数,训练过程能否找到合适参数,以及拟合后的函数能否适应目标分布。第一个判断不能证明后两个。更深的网络可能提供有用的函数分解,但层数本身并不是优化或泛化更好的证据。

对瓶颈与扩张隐藏层也应作相同区分:形状变化必须结合非线性变换及具体任务评估,而不能独立作为有效性的依据。 [2]

参考文献