非线性、深度与残差连接
分析非线性、网络深度与残差路径的作用。
增加网络层的价值在于,通过复合变换表达简单模型难以处理的关系。非线性使模型在不同输入区域具有不同响应,残差路径则让分支学习对已有表示的修正。这两个机制比单独的层数更能说明网络结构的作用。
网络深度、非线性激活与残差相加影响模型的不同性质。分析其作用,需要检查所表示的函数及其导数,而不能仅根据层数判断模型能力。
1. 仿射层的复合
考虑两个形状相容的仿射层:
代入后得到:
因此,这一复合在函数意义上等价于单个仿射映射。对仅包含仿射变换的有限层结构,可以递归应用同一结论。不过,不同参数分解仍可能改变优化行为,因此函数等价并不意味着训练动态相同。[1]
例如,标量层 与 的复合为 。仅增加这类层的数量,不会引入非线性的输入输出关系。
2. 非线性与分段仿射函数
插入 后,得到:
两个区域具有不同斜率,因此不能在整个实数域上用一个仿射表达式替代。直接代入可得 、、。
对于一般 ReLU 网络,固定各层激活单元后,可将激活函数替换为零和一组成的对角掩码。在对应区域内,网络为仿射函数;跨过激活边界,则可能切换到另一个仿射映射。区域之间的变化由此形成非线性行为。 [1]
3. 残差块
输入输出宽度相同的残差块定义为:
直接路径传递 ,可训练分支表示加性修正。对于目标映射 ,相应修正可写为 。在保留输入有用的情况下,分支无需独立重建完整的恒等映射。[2]
取 、,输出为 。当分支输出为零时,模块保留 ,使恒等映射成为一个特别简单的情形。
4. 导数与形状匹配
在可微位置,记 ,输入雅可比矩阵与损失梯度为:
恒等项提供直接的梯度路径,但仍可能发生抵消:当 时,输出与雅可比矩阵同时为零。这个反例明确了直接梯度路径论证的适用边界。
当输入输出宽度不同时,可采用投影快捷路径:
相加前,两条分支必须产生相同形状。投影 不再是等维空间中的恒等映射,其影响需要纳入模块分析。拼接则是另一种操作:它连接坐标,而不是将对应元素相加。 [2]
5. 深度、宽度与评估
深度计量顺序变换阶段,宽度计量某个阶段的分量数量。修改两者都可能改变函数族、计算成本与优化问题;初始化、归一化和学习率仍会影响训练能否找到有用参数。
因此,应区分三个判断:架构能否表示某个函数,训练过程能否找到合适参数,以及拟合后的函数能否适应目标分布。第一个判断不能证明后两个。更深的网络可能提供有用的函数分解,但层数本身并不是优化或泛化更好的证据。
对瓶颈与扩张隐藏层也应作相同区分:形状变化必须结合非线性变换及具体任务评估,而不能独立作为有效性的依据。 [2]