中文

经典统计(样本内)直觉泛化性不佳:关于偏差-方差权衡、过拟合及从固定设计向随机设计转变的注记

机器学习 2024-09-30 v1 机器学习

摘要

双下降和良性过拟合等现代机器学习(ML)现象的突然出现,可能会让许多受过经典训练的统计学家感到不安——这些现象似乎违背了任何关于从数据中学习的入门课程所传授的统计直觉的核心。历史上未能更早观察到此类现象,通常归因于当今对更复杂的ML方法、过参数化、插值和/或更高数据维度的依赖。在本注记中,我们展示了另一个导致我们今天观察到与经典统计学教科书所教直觉不符行为的原因,该原因理解起来要简单得多,却很少被明确讨论。具体而言,许多直觉源于固定设计设定,其中关注的是样本内预测误差(在含噪结果的重采样下),而现代ML根据泛化误差来评估其预测,即随机设计中的样本外预测误差。在这里,我们强调这种从固定设计向随机设计的简单转变对偏差-方差权衡相关的教科书直觉产生了(也许令人惊讶地)深远影响,并讨论了由此导致的在固定设计与随机设计中观察双下降和良性过拟合的(不)可能性。

关键词

引用

@article{arxiv.2409.18842,
  title  = {Classical Statistical (In-Sample) Intuitions Don't Generalize Well: A Note on Bias-Variance Tradeoffs, Overfitting and Moving from Fixed to Random Designs},
  author = {Alicia Curth},
  journal= {arXiv preprint arXiv:2409.18842},
  year   = {2024}
}