正文使用基础代数、有限维线性代数、导数与离散概率。本附录规定共用运算和记号,各篇特有符号在使用处另行定义。下列反复出现的符号在全系列中保留固定用途。
| 符号 |
含义 |
| Lnet |
网络深度,即顺序变换层数 |
| L、ℓ |
损失目标与单样本或单位置损失 |
| J |
优化目标,按具体定义包含正则项 |
| H,W |
图像高、宽,均为标量 |
| W、Wl |
权重矩阵,可带层号 |
| WQ,WK,WV |
注意力投影矩阵 |
| w |
权重向量或标量,依照明确规定的形状 |
| V、Vh |
词表大小与注意力值矩阵 |
标量宽度 W 与权重矩阵 W 同时通过字形与形状区分。其他矩阵保留常用字母,例如 A,B,E;对象首次出现时注明具体形状。
独立公式末尾不放句子标点,前面的引导文字以冒号结束,后面的解释另起一句。公式内部用于分隔数学声明的逗号仍属于记号本身。
1. 向量与矩阵形状
单个向量采用列向量 x∈Rd,x⊤ 表示其转置。对于 A∈Rm×d,乘积 y=Ax∈Rm 按坐标定义为:
yi=j=1∑dAijxj
对于 A∈Rm×d、B∈Rd×n,矩阵乘法采用同样的求和规则:
(AB)ik=j=1∑dAijBjk,AB∈Rm×n
相乘矩阵的内部尺寸必须匹配,且矩阵乘法通常不满足交换律。Ax+b 为仿射映射,当 b=0 时为线性映射。Id 表示 d×d 单位矩阵,1n 表示全一向量,u⊙v 表示逐项相乘。
批量特征向量按行排列为 X∈Rn×d,对应预测为 Xw+b1n。图像张量与序列张量需要分别声明轴顺序。
2. 范数、秩与零空间
欧氏范数及其平方为:
∥x∥2=j∑xj2,∥x∥22=x⊤x
矩阵秩是线性无关列的最大数量,零空间定义为 kerA={v:Av=0}。对于具有 d 列的矩阵,秩与零空间维数满足 d=rank(A)+dimkerA。
这一关系可通过基的扩展说明:先选取零空间的一组基,再将其扩展为整个输入空间的基。新增基向量经过 A 映射后张成像空间,且线性无关;否则,它们的某个非平凡组合将落入零空间,与扩展后的基线性无关矛盾。因此,新增向量的数量就是矩阵秩,与零空间基向量数量相加得到 d。
正交表示点积为零。对于正交向量 u,v,展开 (u+v)⊤(u+v) 后交叉项消失,得到 ∥u+v∥22=∥u∥22+∥v∥22。
3. 导数、梯度与链式法则
标量导数由差商极限定义:
f′(t)=h→0limhf(t+h)−f(t)
对于平方函数,((t+h)2−t2)/h=2t+h,极限为 2t。偏导数 ∂J/∂θj 表示改变一个坐标、保持其余坐标不变时的导数;这些偏导数组成列梯度 ∇J。
对于 y=f(x),雅可比矩阵的第 i 行、第 j 列为 ∂yi/∂xj。标量损失满足:
∂xj∂L=i∑∂yi∂L∂xj∂yi,∇xL=Jf(x)⊤∇yL
反向传播按照与前向计算相反的顺序应用该规则。导数描述局部敏感性;有限距离的参数更新还需要规定步长。
4. 指数与对数
自然指数为 et,其逆函数为定义在 t>0 上的 logt。恒等式 log(ab)=loga+logb 将概率乘积转换为求和。结合导数 (et)′=et、(logt)′=1/t 与链式法则,可得到 softmax 损失的梯度。
具体而言,对于 ℓ=−zy+log∑jezj,第二项对 zk 的导数为 ezk/∑jezj,第一项贡献 −1[k=y],两者相加得到 pk−1[k=y]。
5. 概率、期望与方差
有限离散分布满足 pi≥0、∑ipi=1。对于取值 ai,期望为 E[a]=∑ipiai。这一按概率加权的量不同于已观察样本的经验平均。
当 p(b)>0 时,条件概率为 p(a∣b)=p(a,b)/p(b)。整理得到 p(a,b)=p(a∣b)p(b),重复应用即可分解序列概率,无需假定各位置相互独立。
方差定义为 Var(Z)=E[(Z−EZ)2]=E[Z2]−(EZ)2。独立性属于额外假设,例如计算样本平均的方差时,可以据此消除协方差项。
6. 指示量、索引与近似
指示量 1[condition] 在条件成立时为一,否则为零;⌊t⌋ 表示不大于 t 的最大整数。数组位置与词元 ID 在明确说明处从零编号,样本号与层号则可以从一开始。
记号 r(Δ)=o(∥Δ∥) 表示非零位移趋近零时,r(Δ)/∥Δ∥→0。这一表达规定局部剩余项,并不允许在大步长下直接忽略它。经过舍入的小数属于近似值;推导需要时保留精确分数或表达式。