中文

Grokking 的理论框架:插值后接黎曼范数最小化

机器学习 2025-11-06 v2 最优化与控制 机器学习

摘要

我们研究了在一般训练损失 F:RdRF: \mathbb{R}^d \to \mathbb{R} 上带有小权重衰减的梯度流动力学。在温和的正则性假设和未正则化梯度流收敛的假设下,我们表明带有权重衰减 λ\lambda 的轨迹在 λ0\lambda \to 0 时表现出两阶段行为。在初始的快速阶段,轨迹遵循未正则化的梯度流并收敛到 FF 的临界点流形。然后,在 1/λ1/\lambda 量级的时间,轨迹进入缓慢漂移阶段,并遵循最小化参数 2\ell_2 范数的黎曼梯度流。这种纯粹基于优化的现象为深度学习中观察到的 \textit{grokking} 效应提供了自然的解释,即训练损失迅速降至零,而测试损失在突然改善之前会经历一段长时间的停滞期。我们论证,正如我们的分析所解释的,这种泛化跃迁可归因于权重衰减引起的缓慢范数降低。我们在几个合成回归任务上实证验证了这一机制。

关键词

引用

@article{arxiv.2505.20172,
  title  = {A Theoretical Framework for Grokking: Interpolation followed by Riemannian Norm Minimisation},
  author = {Etienne Boursier and Scott Pesme and Radu-Alexandru Dragomir},
  journal= {arXiv preprint arXiv:2505.20172},
  year   = {2025}
}

备注

NeurIPS 2025 camera ready version