LLM 预训练中的 Grokking?无需测试即可监控记忆到泛化的过渡
机器学习
2026-02-04 v4
摘要
本文首次研究了 LLM 预训练中的 Grokking 现象。具体我们探讨了 LLM 在何时记忆训练数据,何时开始在下游任务上实现泛化,以及如果两个之间存在滞后会发生什么。不同于现有研究聚焦于在数千个 epoch 上处理算法数据时小模型如何泛化到有限特定任务的时机,我们关注的是 LLM 的实际场景,即对跨域大规模语料进行 next-token prediction 的单 epoch 预训练,以及覆盖 math/commonsense reasoning、code generation 和 domain-specific retrieval 的多样化基准任务的泛化。我们的研究首次验证了 Grokking 现象仍在预训练混合专家(Mixture-of-Experts,简称 MoE)LLM 中出现,尽管不同的数据组由于其分布和归因的异质性,可能以不同时间进入其 Grokking 阶段。为寻找这种局部 Grokking 的机制解释,我们检视了训练数据通路(即 MoE 中各层专家选择)的动态。我们的主要发现是,尽管最终的预训练损失收敛,通路仍从随机、跨层不光滑、样本特定的模式演化为更结构化、跨样本可迁移的模式。这描绘了从记忆到泛化的转变。我们开发了两个新指标来量化这些模式:一个计算样本间的通路相似性,另一个衡量每个样本在后续层中聚合专家的一致性。这些基于训练数据的指标开销为零,但能可靠地跟踪和监控 LLM 在下游任务上的泛化,而在传统设置下,这需要高成本的指令微调和基准评估。
引用
@article{arxiv.2506.21551,
title = {Grokking in LLM Pretraining? Monitor Memorization-to-Generalization without Test},
author = {Ziyue Li and Chenrui Fan and Tianyi Zhou},
journal= {arXiv preprint arXiv:2506.21551},
year = {2026}
}
备注
Accepted at ICLR 2026