泛化、过拟合与模型评估
从训练拟合走向新数据,理解泛化与评估。
拟合的目的在于对新样本作出有用预测。模型即使通过所有训练点,也可能在这些点之间或之外表现出完全不同的行为。泛化分析关心现有数据能够支持怎样的延伸,留出评估则测量最终选定的延伸在新样本上的表现。
泛化描述模型在拟合样本之外的表现,其含义取决于目标分布与评估损失。较低的训练误差本身不能证明泛化能力,因为训练观察已经参与了参数选择。
1. 总体风险与经验风险
设 为目标输入与标签的联合分布。对于固定参数 ,总体风险定义为:
在 个已观察样本上的经验风险为:
总体风险通常无法直接得知。在适当的采样与独立性条件下,留出样本的平均损失可用于估计总体风险:评估样本需要代表目标分布,并与已经拟合的过程保持独立。该条件使评估区别于重复使用决定参数的训练观察。[1]
2. 训练拟合的非唯一性
考虑训练样本 、、,以及函数族:
在三个训练输入处,均有 ,因此任意 都能得到零训练平方误差。如果明确规定这些点之外的目标关系为 ,则在 处有:
相同训练误差可以对应任意不同的新样本误差。训练观察本身无法确定系数 ;选择有用的延伸,需要额外准则或其他样本提供的证据。
3. 训练集、验证集与测试集
训练集用于拟合参数,验证集用于选择模型或配置,测试集用于评估最终选定的过程。若 为配置 下的训练结果,验证选择可写为:
随后使用留出的测试集估计所选过程的风险。若反复根据测试结果进行无限制调参,该测试集就不再承担原先意义上的独立评估角色。[2]
依赖数据的预处理也必须遵守相同边界。归一化统计量与特征选择应在对应训练部分拟合,再应用到留出样本。即使预测器尚未训练,提前利用测试标签筛选特征也已经造成数据泄漏。[3]
采样单位同样影响评估。来自同一来源的多条记录,或相关序列中的邻近位置,可能并不独立。当随机按行划分不符合实际评估目标时,需要考虑按组或按时间划分。
4. 准确率与采样不确定性
对于固定分类器与独立同分布的测试样本,设 、,则:
由于 ,单个指示变量的方差为 。独立性使交叉协方差为零,从而得到上述平均值方差。以 替换未知的 ,得到标准误估计 ;这一数值本身并不是精确置信区间。
当 、 时,估计标准误为 。对于强相关测试结果,或反复根据同一测试集选择的分类器,不能不加修改地沿用该公式。
5. 过拟合、指标选择与分布变化
过拟合指对当前样本特有变化的适应,没有相应转化为目标分布上的表现。在可比较的评估条件下,继续拟合可能降低训练损失,却提高留出损失。仅存在非零差距并不能确定原因;分布差异、泄漏、样本量与标签质量都会影响这种比较。
评估指标也有适用边界。在包含 90 个正例、10 个负例的二分类数据中,始终预测正类可获得 90% 准确率,但负类召回率为 0%。因此,评估需要结合类别结构和相关错误成本,不能只报告准确率。
若部署分布为 ,关注的对象就变成 ,而不是 。即使在 上获得无偏估计,也不能据此保证在 上的表现。评估结论需要明确对应的分布、损失与采样条件。 [1]