AI 课程网站首页
返回知识库

泛化、过拟合与模型评估

从训练拟合走向新数据,理解泛化与评估。

本篇目录
  1. 总体风险与经验风险
  2. 训练拟合的非唯一性
  3. 训练集、验证集与测试集
  4. 准确率与采样不确定性
  5. 过拟合、指标选择与分布变化
  6. 参考文献

拟合的目的在于对新样本作出有用预测。模型即使通过所有训练点,也可能在这些点之间或之外表现出完全不同的行为。泛化分析关心现有数据能够支持怎样的延伸,留出评估则测量最终选定的延伸在新样本上的表现。

泛化描述模型在拟合样本之外的表现,其含义取决于目标分布与评估损失。较低的训练误差本身不能证明泛化能力,因为训练观察已经参与了参数选择。

1. 总体风险与经验风险

设 PP 为目标输入与标签的联合分布。对于固定参数 θ\theta,总体风险定义为:

RP(θ)=E(x,y)∼P[ℓ(fθ(x),y)]R_P(\theta)=\mathbb E_{(x,y)\sim P} [\ell(f_\theta(x),y)]

在 nn 个已观察样本上的经验风险为:

R^n(θ)=1n∑i=1nℓ(fθ(xi),yi)\widehat R_n(\theta)=\frac1n\sum_{i=1}^{n} \ell(f_\theta(x_i),y_i)

总体风险通常无法直接得知。在适当的采样与独立性条件下,留出样本的平均损失可用于估计总体风险:评估样本需要代表目标分布,并与已经拟合的过程保持独立。该条件使评估区别于重复使用决定参数的训练观察。[1]

2. 训练拟合的非唯一性

考虑训练样本 (−1,1)(-1,1)、(0,0)(0,0)、(1,1)(1,1),以及函数族:

fc(x)=x2+c x(x2−1),c∈Rf_c(x)=x^2+c\,x(x^2-1),\qquad c\in\mathbb R

在三个训练输入处,均有 x(x2−1)=0x(x^2-1)=0,因此任意 cc 都能得到零训练平方误差。如果明确规定这些点之外的目标关系为 y=x2y=x^2,则在 x=2x=2 处有:

fc(2)=4+6c,(fc(2)−4)2=36c2f_c(2)=4+6c,\qquad (f_c(2)-4)^2=36c^2

相同训练误差可以对应任意不同的新样本误差。训练观察本身无法确定系数 cc;选择有用的延伸,需要额外准则或其他样本提供的证据。

3. 训练集、验证集与测试集

训练集用于拟合参数,验证集用于选择模型或配置,测试集用于评估最终选定的过程。若 θλ\theta_\lambda 为配置 λ\lambda 下的训练结果,验证选择可写为:

λ∗∈arg⁡min⁡λ∈ΛR^val(θλ)\lambda^*\in\arg\min_{\lambda\in\Lambda} \widehat R_{\mathrm{val}}(\theta_\lambda)

随后使用留出的测试集估计所选过程的风险。若反复根据测试结果进行无限制调参,该测试集就不再承担原先意义上的独立评估角色。[2]

依赖数据的预处理也必须遵守相同边界。归一化统计量与特征选择应在对应训练部分拟合,再应用到留出样本。即使预测器尚未训练,提前利用测试标签筛选特征也已经造成数据泄漏。[3]

采样单位同样影响评估。来自同一来源的多条记录,或相关序列中的邻近位置,可能并不独立。当随机按行划分不符合实际评估目标时,需要考虑按组或按时间划分。

4. 准确率与采样不确定性

对于固定分类器与独立同分布的测试样本,设 Zi=1[y^i=yi]Z_i=\mathbf1[\hat y_i=y_i]、p=Pr⁡(y^=y)p=\Pr(\hat y=y),则:

p^=1m∑i=1mZi,E[p^]=p,Var⁡(p^)=p(1−p)m\hat p=\frac1m\sum_{i=1}^{m}Z_i, \qquad \mathbb E[\hat p]=p, \qquad \operatorname{Var}(\hat p)=\frac{p(1-p)}{m}

由于 Zi2=ZiZ_i^2=Z_i,单个指示变量的方差为 p−p2p-p^2。独立性使交叉协方差为零,从而得到上述平均值方差。以 p^\hat p 替换未知的 pp,得到标准误估计 p^(1−p^)/m\sqrt{\hat p(1-\hat p)/m};这一数值本身并不是精确置信区间。

当 m=100m=100、p^=0.9\hat p=0.9 时,估计标准误为 0.030.03。对于强相关测试结果,或反复根据同一测试集选择的分类器,不能不加修改地沿用该公式。

5. 过拟合、指标选择与分布变化

过拟合指对当前样本特有变化的适应,没有相应转化为目标分布上的表现。在可比较的评估条件下,继续拟合可能降低训练损失,却提高留出损失。仅存在非零差距并不能确定原因;分布差异、泄漏、样本量与标签质量都会影响这种比较。

评估指标也有适用边界。在包含 90 个正例、10 个负例的二分类数据中,始终预测正类可获得 90% 准确率,但负类召回率为 0%。因此,评估需要结合类别结构和相关错误成本,不能只报告准确率。

若部署分布为 QQ,关注的对象就变成 RQ(θ)R_Q(\theta),而不是 RP(θ)R_P(\theta)。即使在 PP 上获得无偏估计,也不能据此保证在 QQ 上的表现。评估结论需要明确对应的分布、损失与采样条件。 [1]

参考文献