关于良性过拟合的古典视角:样本大小的作用
机器学习
2025-05-20 v1 人工智能
机器学习
摘要
良性过拟合是机器学习中的一种现象,即模型在训练数据上完美拟合(包括带噪声的样本),但仍能良好地泛化到未见数据。近年来,人们对理解这一现象引起了广泛关注。本文提出一种概念性的转变,关注近似良性过拟合,即模型同时实现任意小的训练误差和测试误差。这一行为是神经网络的典型特征,神经网络通常实现较低(但非零)的训练误差,同时仍能良好地泛化。我们假设,近似良性过拟合即使在古典范式下也能出现,通过分析样本大小与模型复杂度之间的相互作用,较大的模型能够同时获得良好的训练拟合优度,但仍能接近贝叶斯最优的泛化。我们通过两个案例研究获得理论证据来 substantiate 这一假设:(i)核岭回归,和(ii)使用两层全连接ReLU神经网络通过梯度流训练的最小二乘回归。在这两种情况下,我们克服了先前关于良性过拟合所需的强假设。我们的神经网络结果还提供了首个不依赖于底层回归函数或噪声(除有界性之外)任何假设的泛化结果。我们的分析引入了一种新颖的证明技术,通过将剩余风险分解为估计误差和逼近误差,解释梯度流作为隐式正则化器,以帮助避免统一收敛陷阱。这一分析思路可能是独立的兴趣。
引用
@article{arxiv.2505.11621,
title = {A Classical View on Benign Overfitting: The Role of Sample Size},
author = {Junhyung Park and Patrick Bloebaum and Shiva Prasad Kasiviswanathan},
journal= {arXiv preprint arXiv:2505.11621},
year = {2025}
}
备注
The results here subsume: arXiv:2410.06191