预测变化可能来自输入改变、系数更新或训练配置变化。特征、参数与超参数分别对应这三个层次。通过一个小型线性模型,可以先明确每个量在计算中的作用,再把这一区分用于神经网络。
特征、参数与超参数分别描述学习过程中的不同角色。特征表示输入,参数决定模型映射,超参数配置训练过程或模型族。三者的区别取决于明确规定的优化过程,而不取决于某个量是否以数字存储。
1. 特征与预测参数
设特征向量为 x∈Rd,权重为 w∈Rd,偏置为标量 b。线性回归的预测为:
y^=w⊤x+b=j=1∑dwjxj+b
x 的分量描述当前样本,(w,b) 中的 d+1 个量规定共享的预测规则。样本变化会改变 x,但不一定改变模型;拟合则根据训练目标调整 (w,b)。[1]
取 x=(2,−1)⊤、w=(3,4)⊤、b=0.5,预测为:
y^=3⋅2+4⋅(−1)+0.5=2.5
将第二个权重从四改为五,预测变为 1.5。该例固定输入,只改变参数。若保持原权重而更换输入,产生的则是激活值或输出的变化,不能等同于参数更新。
2. 批量表示与激活值
将 n 个特征向量按行排列,得到 X∈Rn×d。整批预测可写为:
y^=Xw+b1n∈Rn
其中,1n 为全一向量。取:
X=[20−11],w=[34]
并令 b=0.5,得到 (2.5,4.5)⊤。该模型具有三个参数,当前批次产生两个输出值。增加样本数量会增加输出数量,但不会增加共享参数的数量。
神经网络内部也存在同样的区别:激活值是特定输入产生的中间计算结果,权重则是在多次计算中重复使用的系数。即使两者都采用数组存储,其数学角色也不同。 [1]
3. 固定特征与可学习特征
固定特征变换可以定义为 ϕ(x)=(x1,x2,x1x2)⊤。第三个分量引入原始坐标之间的非线性交互,因此,在 ϕ(x) 上建立线性预测器,可以表示相对于原输入 x 非仿射的函数。
如果特征构造方式在拟合中保持不变,这一表示仍然是固定的。相比之下,ϕα(x) 包含可调整参数 α;端到端学习可以同时优化表示与最终预测函数。因此,特征构造与参数学习相互关联,但并非同一个操作。
4. 超参数与模型选择
设 λ 汇总学习率、隐藏层宽度、正则系数或训练时长等配置。有限训练过程的输出可表示为:
θλ=Train(Dtrain;λ)
该记号同时包含训练过程与配置,不预设过程能够精确求得最小值。给定有限候选集合 Λ,基于验证集的选择可写为:
λ∗∈argλ∈ΛminRval(θλ)
超参数位于当前训练运行的常规参数更新之外,但不必由人工逐一选择;独立的搜索或优化过程也可以确定这些配置。区别在于当前讨论的是哪一层优化问题。[2]
5. 正则化例子
对于批量目标 y∈Rn,带正则项的线性回归目标可写为:
J(w,b)=2n1∥Xw+b1n−y∥22+2ρ∥w∥22,ρ≥0
第一项为带 1/2 系数的平均平方残差,第二项惩罚权重幅度;这一具体定义不惩罚偏置。模型参数为 w,b,而 ρ 控制惩罚项的相对强度。
正则项对权重的导数为 ρw,它与未正则化的权重梯度相加。由此可见,超参数可以直接影响参数更新,而不必由同一更新规则调整自身。完整的学习过程需要说明可调整变量、固定量及选择方式,仅给出术语名称还不足以确定计算。
参考文献