洞悉深度泛化:岭回归中的可证明泛化延迟现象
机器学习
2026-02-09 v2 机器学习
摘要
我们研究了深度泛化——在过度拟合很久之后泛化开始出现的现象——在经典岭回归设置中。我们证明了使用带权重衰减的梯度下降学习过参数化线性回归模型的端到端深度泛化结果。具体而言,我们证明了以下阶段出现:(i)模型在训练早期过拟合训练数据;(ii)在过度拟合表现出来后很长时间内,泛化性能仍然较差;(iii)泛化误差最终可以任意小。此外,我们从理论和实证两方面表明,通过适当的超参数调优,深度泛化可以被放大或消除。据我们所知,这些是关于泛化延迟(我们称之为'深度泛化时间')相对于训练超参数的首次严格定量界限。最后,我们超越了线性设置,实证表明我们的定量界限也能捕捉非线性神经网络上深度泛化的行为。我们的结果表明,深度泛化不是深度学习的固有失败模式,而是特定训练条件的结果,因此不需要对模型架构或学习算法进行根本性改变来避免它。
引用
@article{arxiv.2601.19791,
title = {To Grok Grokking: Provable Grokking in Ridge Regression},
author = {Mingyue Xu and Gal Vardi and Itay Safran},
journal= {arXiv preprint arXiv:2601.19791},
year = {2026}
}