为“该”泛化误差构建置信区间——一项全面的基准研究
机器学习
2025-01-16 v2 机器学习
摘要
在评估机器学习预测模型的质量时,用于衡量预测性能的泛化误差的置信区间(CI)是一个关键工具。幸运的是,已有许多计算此类 CI 的方法,且不断有新的有前景的方法被提出。通常,这些方法将各种重采样过程(其中最流行的是交叉验证和自举法)与不同的方差估计技术相结合。然而遗憾的是,目前对于何时可以最可靠地使用这些组合以及它们总体上如何比较,尚未达成共识。在这项工作中,我们进行了一项比较泛化误差 CI 的大规模研究,这是首个此类规模的研究,我们在总共 19 个表格回归和分类问题上实证评估了 13 种不同的 CI 方法,使用了 7 种不同的诱导器和总共 8 种损失函数。我们概述了为泛化误差构建 CI 的方法学基础和固有挑战,并在统一框架下对所有 13 种方法进行了简明回顾。最后,从相对覆盖频率、宽度和运行时间方面对 CI 方法进行了评估。基于这些发现,我们确定了一组我们推荐的方法子集。我们还将数据集作为基准测试套件发布在 OpenML 上,并将代码发布在 GitHub 上,以作为进一步研究的基础。
引用
@article{arxiv.2409.18836,
title = {Constructing Confidence Intervals for 'the' Generalization Error -- a Comprehensive Benchmark Study},
author = {Hannah Schulz-Kümpel and Sebastian Fischer and Roman Hornung and Anne-Laure Boulesteix and Thomas Nagler and Bernd Bischl},
journal= {arXiv preprint arXiv:2409.18836},
year = {2025}
}