中文

Grokking 的几何学:零损失流形上的范数最小化

机器学习 2026-01-12 v2 人工智能

摘要

Grokking 是神经网络中的一种现象,即在完全记忆训练数据后,才会发生显著的推理。以往的研究将这种延迟性推理联系到权重衰减驱动的表示学习,但其确切的底层动力学仍不清晰。本文从受约束优化的视角来理解记忆后的学习,认为梯度下降实际上是在零损失流形上最小化权重范数。我们在学习率和权重衰减系数趋于无穷小的极限下,对此进行了形式化证明。为进一步剖析这一 regime,本文引入了一种近似方法,将网络中一部分参数的学习动力学从其余部分中解耦。应用这一框架,我们推导了两层网络中第一层记忆后动力学的闭式表达式。实验结果表明,使用我们预测的梯度模拟训练过程,能够复现 grokking 的延迟推理及其表示学习特征。

关键词

引用

@article{arxiv.2511.01938,
  title  = {The Geometry of Grokking: Norm Minimization on the Zero-Loss Manifold},
  author = {Tiberiu Musat},
  journal= {arXiv preprint arXiv:2511.01938},
  year   = {2026}
}