中文

Rip van Winkle 的剃刀:一种对测试数据过拟合的简单估计

机器学习 2021-03-01 v1 机器学习

摘要

传统统计学禁止在训练期间使用测试数据(亦称保留数据)。Dwork 等人 2015 指出,机器学习当前的做法——研究者相互借鉴模型、复制超参数乃至计算机代码——相当于对测试集进行了隐式训练。因此测试数据上的错误率可能无法反映真实的群体错误率。该观察引发了{\em 自适应数据分析},其提供了保证上述差异上界的可评估机制。在统计查询(即测试准确率)反馈下,最佳上界相当悲观:若测试模型数量为测试集大小的平方,偏差可达到实际上空泛无用的取值。本工作中,我们提出一种简单的新估计,{\em Rip van Winkle 的剃刀}。它依赖于模型“信息内容”的新概念:须提供给一位熟悉该领域及相关科学/数学、且在测试数据创建那一刻刚睡着的专家裁判(如同著名童话中“Rip van Winkle”般)的信息量。该信息内容概念被用于估计上述偏差,并证明在许多现代设定下为非空泛的。

关键词

引用

@article{arxiv.2102.13189,
  title  = {Rip van Winkle's Razor: A Simple Estimate of Overfit to Test Data},
  author = {Sanjeev Arora and Yi Zhang},
  journal= {arXiv preprint arXiv:2102.13189},
  year   = {2021}
}