AI 课程网站首页
返回知识库

数学记号与基础

本篇目录
  1. 向量与矩阵形状
  2. 范数、秩与零空间
  3. 导数、梯度与链式法则
  4. 指数与对数
  5. 概率、期望与方差
  6. 指示量、索引与近似

正文使用基础代数、有限维线性代数、导数与离散概率。本附录规定共用运算和记号,各篇特有符号在使用处另行定义。下列反复出现的符号在全系列中保留固定用途。

符号 含义
LnetL_{\mathrm{net}} 网络深度,即顺序变换层数
L\mathcal L、ℓ\ell 损失目标与单样本或单位置损失
JJ 优化目标,按具体定义包含正则项
H,WH,W 图像高、宽,均为标量
W\mathbf{W}、Wl\mathbf{W}_l 权重矩阵,可带层号
WQ,WK,WV\mathbf{W}_Q,\mathbf{W}_K,\mathbf{W}_V 注意力投影矩阵
ww 权重向量或标量,依照明确规定的形状
VV、VhV_h 词表大小与注意力值矩阵

标量宽度 WW 与权重矩阵 W\mathbf{W} 同时通过字形与形状区分。其他矩阵保留常用字母,例如 A,B,EA,B,E;对象首次出现时注明具体形状。

独立公式末尾不放句子标点,前面的引导文字以冒号结束,后面的解释另起一句。公式内部用于分隔数学声明的逗号仍属于记号本身。

1. 向量与矩阵形状

单个向量采用列向量 x∈Rdx\in\mathbb R^d,x⊤x^\top 表示其转置。对于 A∈Rm×dA\in\mathbb R^{m\times d},乘积 y=Ax∈Rmy=Ax\in\mathbb R^m 按坐标定义为:

yi=∑j=1dAijxjy_i=\sum_{j=1}^d A_{ij}x_j

对于 A∈Rm×dA\in\mathbb R^{m\times d}、B∈Rd×nB\in\mathbb R^{d\times n},矩阵乘法采用同样的求和规则:

(AB)ik=∑j=1dAijBjk,AB∈Rm×n(AB)_{ik}=\sum_{j=1}^d A_{ij}B_{jk},\qquad AB\in\mathbb R^{m\times n}

相乘矩阵的内部尺寸必须匹配,且矩阵乘法通常不满足交换律。Ax+bAx+b 为仿射映射,当 b=0b=0 时为线性映射。IdI_d 表示 d×dd\times d 单位矩阵,1n\mathbf1_n 表示全一向量,u⊙vu\odot v 表示逐项相乘。

批量特征向量按行排列为 X∈Rn×dX\in\mathbb R^{n\times d},对应预测为 Xw+b1nXw+b\mathbf1_n。图像张量与序列张量需要分别声明轴顺序。

2. 范数、秩与零空间

欧氏范数及其平方为:

∥x∥2=∑jxj2,∥x∥22=x⊤x\|x\|_2=\sqrt{\sum_jx_j^2},\qquad \|x\|_2^2=x^\top x

矩阵秩是线性无关列的最大数量,零空间定义为 ker⁡A={v:Av=0}\ker A=\{v:Av=0\}。对于具有 dd 列的矩阵,秩与零空间维数满足 d=rank⁡(A)+dim⁡ker⁡Ad=\operatorname{rank}(A)+\dim\ker A。

这一关系可通过基的扩展说明:先选取零空间的一组基,再将其扩展为整个输入空间的基。新增基向量经过 AA 映射后张成像空间,且线性无关;否则,它们的某个非平凡组合将落入零空间,与扩展后的基线性无关矛盾。因此,新增向量的数量就是矩阵秩,与零空间基向量数量相加得到 dd。

正交表示点积为零。对于正交向量 u,vu,v,展开 (u+v)⊤(u+v)(u+v)^\top(u+v) 后交叉项消失,得到 ∥u+v∥22=∥u∥22+∥v∥22\|u+v\|_2^2=\|u\|_2^2+\|v\|_2^2。

3. 导数、梯度与链式法则

标量导数由差商极限定义:

f′(t)=lim⁡h→0f(t+h)−f(t)hf'(t)=\lim_{h\to0}\frac{f(t+h)-f(t)}h

对于平方函数,((t+h)2−t2)/h=2t+h((t+h)^2-t^2)/h=2t+h,极限为 2t2t。偏导数 ∂J/∂θj\partial J/\partial\theta_j 表示改变一个坐标、保持其余坐标不变时的导数;这些偏导数组成列梯度 ∇J\nabla J。

对于 y=f(x)y=f(x),雅可比矩阵的第 ii 行、第 jj 列为 ∂yi/∂xj\partial y_i/\partial x_j。标量损失满足:

∂L∂xj=∑i∂L∂yi∂yi∂xj,∇xL=Jf(x)⊤∇yL\frac{\partial \mathcal L}{\partial x_j}=\sum_i\frac{\partial \mathcal L}{\partial y_i}\frac{\partial y_i}{\partial x_j},\qquad \nabla_xL=J_f(x)^\top\nabla_yL

反向传播按照与前向计算相反的顺序应用该规则。导数描述局部敏感性;有限距离的参数更新还需要规定步长。

4. 指数与对数

自然指数为 ete^t,其逆函数为定义在 t>0t>0 上的 log⁡t\log t。恒等式 log⁡(ab)=log⁡a+log⁡b\log(ab)=\log a+\log b 将概率乘积转换为求和。结合导数 (et)′=et(e^t)'=e^t、(log⁡t)′=1/t(\log t)'=1/t 与链式法则,可得到 softmax 损失的梯度。

具体而言,对于 ℓ=−zy+log⁡∑jezj\ell=-z_y+\log\sum_j e^{z_j},第二项对 zkz_k 的导数为 ezk/∑jezje^{z_k}/\sum_j e^{z_j},第一项贡献 −1[k=y]-\mathbf1[k=y],两者相加得到 pk−1[k=y]p_k-\mathbf1[k=y]。

5. 概率、期望与方差

有限离散分布满足 pi≥0p_i\ge0、∑ipi=1\sum_i p_i=1。对于取值 aia_i,期望为 E[a]=∑ipiai\mathbb E[a]=\sum_i p_i a_i。这一按概率加权的量不同于已观察样本的经验平均。

当 p(b)>0p(b)>0 时,条件概率为 p(a∣b)=p(a,b)/p(b)p(a\mid b)=p(a,b)/p(b)。整理得到 p(a,b)=p(a∣b)p(b)p(a,b)=p(a\mid b)p(b),重复应用即可分解序列概率,无需假定各位置相互独立。

方差定义为 Var⁡(Z)=E[(Z−EZ)2]=E[Z2]−(EZ)2\operatorname{Var}(Z)=\mathbb E[(Z-\mathbb EZ)^2]=\mathbb E[Z^2]-(\mathbb EZ)^2。独立性属于额外假设,例如计算样本平均的方差时,可以据此消除协方差项。

6. 指示量、索引与近似

指示量 1[condition]\mathbf1[\text{condition}] 在条件成立时为一,否则为零;⌊t⌋\lfloor t\rfloor 表示不大于 tt 的最大整数。数组位置与词元 ID 在明确说明处从零编号,样本号与层号则可以从一开始。

记号 r(Δ)=o(∥Δ∥)r(\Delta)=o(\|\Delta\|) 表示非零位移趋近零时,r(Δ)/∥Δ∥→0r(\Delta)/\|\Delta\|\to0。这一表达规定局部剩余项,并不允许在大步长下直接忽略它。经过舍入的小数属于近似值;推导需要时保留精确分数或表达式。