中文

过拟合存在局限性:基于 Rényi 熵的模型无关泛化间隙界

机器学习 2026-05-18 v3 信息论 机器学习 math.IT 统计理论 统计理论

摘要

机器学习模型的进一步规模化能否持续带来成功?回答这一问题的重大挑战在于理解泛化间隙,即过拟合的影响。由于传统分析通常将误差界与模型复杂度相关联,无法充分解释超大规模架构的成功,因此理解日益大规模机器学习模型的泛化间隙行为仍是一个重要的研究领域。本研究通过建立一个模型无关的泛化间隙上界引入了新视角,该上界适用于输出仅由数据直方图决定的算法,如经验风险最小化或基于梯度的方法。关键在于,该界被证明仅依赖于数据生成分布的 Rényi 熵,这表明只要数据量相对于该熵足够充分,即使模型任意大,也能维持较小的泛化间隙。该框架直接解释了向数据中注入随机噪声后泛化性能显著下降的现象,将性能下降归因于数据分布的 Rényi 熵随之增加。此外,我们将没有免费午餐定理调整为数据分布依赖的形式,证明与 Rényi 熵相对应的数据量对于成功学习确实是必不可少的,从而突显了我们所提泛化界的紧致性。

关键词

引用

@article{arxiv.2506.00182,
  title  = {Overfitting has a limitation: a model-independent generalization gap bound based on R\'enyi entropy},
  author = {Atsushi Suzuki and Jing Wang},
  journal= {arXiv preprint arXiv:2506.00182},
  year   = {2026}
}