Grokking 的理论框架:插值后接黎曼范数最小化
机器学习
2025-11-06 v2 最优化与控制
机器学习
摘要
我们研究了在一般训练损失 上带有小权重衰减的梯度流动力学。在温和的正则性假设和未正则化梯度流收敛的假设下,我们表明带有权重衰减 的轨迹在 时表现出两阶段行为。在初始的快速阶段,轨迹遵循未正则化的梯度流并收敛到 的临界点流形。然后,在 量级的时间,轨迹进入缓慢漂移阶段,并遵循最小化参数 范数的黎曼梯度流。这种纯粹基于优化的现象为深度学习中观察到的 \textit{grokking} 效应提供了自然的解释,即训练损失迅速降至零,而测试损失在突然改善之前会经历一段长时间的停滞期。我们论证,正如我们的分析所解释的,这种泛化跃迁可归因于权重衰减引起的缓慢范数降低。我们在几个合成回归任务上实证验证了这一机制。
引用
@article{arxiv.2505.20172,
title = {A Theoretical Framework for Grokking: Interpolation followed by Riemannian Norm Minimisation},
author = {Etienne Boursier and Scott Pesme and Radu-Alexandru Dragomir},
journal= {arXiv preprint arXiv:2505.20172},
year = {2025}
}
备注
NeurIPS 2025 camera ready version