中文

Grokking 与学习:相同特征,不同编码

机器学习 2025-02-05 v1 无序系统与神经网络 人工智能

摘要

Grokking 通常能达到与普通“稳定”学习相似的损失。我们探究这些不同的学习路径——grokking 与普通训练——是否会导致所学模型产生根本性差异。为此,我们在两个任务中比较了通过每种路径训练的模型的特征、可压缩性和学习动力学。我们发现,grokking 和稳定训练的模型学习到了相同的特征,但在编码这些特征的效率上可能存在巨大差异。特别地,我们发现了一种稳定训练中新颖的“压缩区”,在该区域中,模型损失与可压缩性之间出现了线性权衡,而这种现象在 grokking 中不存在。在此区域,我们可以实现比基础模型高 25 倍、比 grokking 中实现的压缩高 5 倍的压缩因子。然后,我们追踪了模型特征和可压缩性在训练过程中的发展。我们表明,grokking 中的模型发展是任务依赖的,并且峰值可压缩性在 grokking 平台期之后立即达到。最后,我们引入了新颖的信息几何度量,证明经历 grokking 的模型在信息空间中遵循一条直线路径。

关键词

引用

@article{arxiv.2502.01739,
  title  = {Grokking vs. Learning: Same Features, Different Encodings},
  author = {Dmitry Manning-Coe and Jacopo Gliozzi and Alexander G. Stapleton and Edward Hirst and Giuseppe De Tomasi and Barry Bradlyn and David S. Berman},
  journal= {arXiv preprint arXiv:2502.01739},
  year   = {2025}
}

备注

Code available at: https://github.com/xand-stapleton/grokking_vs_learning