稳定学习器下 K 折交叉验证的偏差
统计理论
2023-06-13 v2 统计理论
摘要
本文研究 K 折交叉验证(CV)程序及其去偏版本作为估计学习算法泛化风险手段的效率。我们在均匀算法稳定性的总体假设下工作。我们表明,在此类一般稳定性假设下,K 折风险估计可能不一致,通过在正则化经验风险最小化和随机梯度下降等现实情境中构造误差的非消失下界来证明。因此我们提倡使用 K 折的去偏版本,并针对该版本证明了具有指数尾衰减的误差界。我们的结果适用于大类均匀稳定算法,不同于早期聚焦于密度估计等特定任务的工作。我们在一个简单的模型选择问题上说明了去偏 K 折 CV 的相关性,并在真实世界分类与回归数据集上通过实验证明了所倡导方法的实用性。
引用
@article{arxiv.2202.10211,
title = {On the bias of K-fold cross validation with stable learners},
author = {Anass Aghbalou and François Portier and Anne Sabourin},
journal= {arXiv preprint arXiv:2202.10211},
year = {2023}
}