中文

减少基于挑战的竞赛中的过拟合

应用统计 2016-07-04 v1

摘要

过拟合是基于挑战的竞赛中一个可怕的对手。由于参赛者依赖公开排行榜来评估和改进他们的模型,他们总是存在过度拟合支撑排行榜的保留数据的风险。最近发布的 Ladder 算法旨在解决此问题,通过防止参赛者在模型改进过程中有意或无意地利用公开排行榜分数的微小波动。在本文中,我们报告了 Ladder 的一个漏洞,当样本量较小时,该漏洞会导致排行榜的严重过拟合。为规避此攻击,我们提出了 Ladder 的一种变体,它发布公开排行榜分数的自助估计值,而不是向参赛者提供直接的性能度量。我们还通过依赖基于贝叶斯自助法(Bayesian bootstrap)的更广泛适用的检验程序,将 Ladder 的适用范围扩展到任意性能度量。我们的方法使得即使在数据稀缺的情况下,也能使用排行榜,并发挥其技术和社会优势。

关键词

引用

@article{arxiv.1607.00091,
  title  = {Reducing overfitting in challenge-based competitions},
  author = {Elias Chaibub Neto and Bruce R Hoff and Chris Bare and Brian M Bot and Thomas Yu and Lara Magravite and Andrew D Trister and Thea Norman and Pablo Meyer and Julio Saez-Rodrigues and James C Costello and Justin Guinney and Gustavo Stolovitzky},
  journal= {arXiv preprint arXiv:1607.00091},
  year   = {2016}
}