中文

Grokking 的规范-分离延迟法则:基于第一性原理的推迟泛化理论

人工智能 2026-05-05 v2 机器学习

摘要

Grokking——即在模型完全记忆训练数据后才出现的突然泛化——已被广泛观察,但缺乏解释延迟长度的定量理论。我们指出,grokking 是正则化训练动力学中由范数驱动的表征相变,并建立了规范-分离延迟法则:TgrokTmem=Θ(γeff1log(θmem2/θpost2))T_{\mathrm{grok}} - T_{\mathrm{mem}} = \Theta(\gamma_{\mathrm{eff}}^{-1} \log(\|\theta_{\mathrm{mem}}\|^2 / \|\theta_{\mathrm{post}}\|^2)),其中 γeff\gamma_{\mathrm{eff}} 为优化器的有效收缩率(SGD 时 γeff=ηλ\gamma_{\mathrm{eff}} = \eta\lambda,AdamW 时 γeffηλ\gamma_{\mathrm{eff}} \ge \eta\lambda)。上界来源于离散 Lyapunov 收缩论证;下界来源于正则化一阶优化的动力学约束。在覆盖模块加法、模块乘法和稀疏奇偶校验的 293 组训练实验中,我们确认了三项可验证的预测:与权重衰减的反比例关系(R2=0.97R^2 = 0.97)、与学习率的反比例关系(R2=0.92R^2 = 0.92)以及范数比值的对数依赖性(Pearson r=0.91r = 0.91)。还发现,grokking 需要优化器能够实现记忆与收缩的解耦:在相同超参数下,SGD 完全无法实现 grokking,而 AdamW 能可靠地实现。这些结果将 grokking 从神秘的优化副产物重新框定为范数在竞争插值表征之间分离的可预测结果。我们进一步推导了一个基于三输入的实用算法,能在记忆时预测 grokking 延迟,平均绝对误差为 34.6%(bootstrap 95% 置信区间 [30.0%, 39.4%],N=60N=60 个随机种子),从而实现原则化的提前停止。

关键词

引用

@article{arxiv.2603.13331,
  title  = {The Norm-Separation Delay Law of Grokking: A First-Principles Theory of Delayed Generalization},
  author = {Truong Xuan Khanh and Truong Quynh Hoa and Luu Duc Trung and Phan Thanh Duc},
  journal= {arXiv preprint arXiv:2603.13331},
  year   = {2026}
}

备注

38 pages, 6 figs