中文

为模块化加法解释“Grokking”现象

机器学习 2024-07-18 v1 机器学习

摘要

我们对“grokking”现象进行理论解释,即模型在过拟合后仍长时间泛化,针对最初研究的模块化加法问题。首先,我们表明,在梯度下降初期,当“核态”approximately holds时,除非模型看到至少一定比例的所有可能数据点,否则无法实现小的population error。然而,模型最终会摆脱核态。我们表明,两层二次网络在有界的\ell_{\infty}范数下实现零训练损失,并且能用显著更少的训练点进行良好泛化;进一步表明,这些网络存在且可被梯度下降通过小的\ell_{\infty}正则化找到。我们进一步提供经验证据表明,这些网络以及简单的Transformer在初始过拟合后才会摆脱核态。综上所述,我们的结果强有力地支持将grokking解释为从类似核的行为向深度网络梯度下降的极限行为过渡的结果。

关键词

引用

@article{arxiv.2407.12332,
  title  = {Why Do You Grok? A Theoretical Analysis of Grokking Modular Addition},
  author = {Mohamad Amin Mohamadi and Zhiyuan Li and Lei Wu and Danica J. Sutherland},
  journal= {arXiv preprint arXiv:2407.12332},
  year   = {2024}
}

备注

Accepted by ICML 2024