中文

分布偏差损害留一法交叉验证

统计方法学 2025-03-25 v2 机器学习 定量方法

摘要

交叉验证是评估机器学习模型预测性能的常用方法。在数据稀缺的情况下,人们通常希望最大化用于训练模型的实例数量,因此常采用“留一法交叉验证”。在这种设计中,针对每个数据实例,在基于所有其他实例训练后构建一个单独的模型进行预测。由于每个训练的模型只有一个测试实例可用,因此在整个数据集上聚合预测结果以计算常见性能指标,如受试者工作特征曲线下面积或R2分数。在这项工作中,我们证明这种方法会在每个训练折叠的平均标签与其对应测试实例的标签之间产生负相关,我们将这种现象称为分布偏差。由于机器学习模型倾向于回归到其训练数据的均值,这种分布偏差往往会对性能评估和超参数优化产生负面影响。我们表明,这种效应推广到留P法交叉验证,并在广泛的建模和评估方法中持续存在,并且可能导致对更强正则化的偏见。为了解决这个问题,我们提出了一种可推广的再平衡交叉验证方法,该方法纠正了分类和回归中的分布偏差。我们通过合成模拟、机器学习基准测试以及几个已发表的留一法分析证明,我们的方法改进了交叉验证性能评估。

关键词

引用

@article{arxiv.2406.01652,
  title  = {Distributional bias compromises leave-one-out cross-validation},
  author = {George I. Austin and Itsik Pe'er and Tal Korem},
  journal= {arXiv preprint arXiv:2406.01652},
  year   = {2025}
}

备注

29 pages, 6 figures, supplementary information