Grokking 经验研究:深度、架构、激活函数与正则化
机器学习
2026-03-27 v1
摘要
神经网络中从记忆向泛化的延迟转移(grokking)仍然鲜有了解,部分原因在于先前的实证研究混合了架构、优化和正则化的作用。我们提出了一项受控研究,通过在模块化加法(mod 97)上系统性地 disentangle 这些因素,采用匹配且经过精心调优的训练方案。我们的核心发现表明,grokking 动力学主要由优化稳定性和正则化共同决定,而非由架构决定。具体地,我们证明:(1)**深度具有非单调作用**,深度为 4 的 MLP 持续无法实现 grokking,而深度为 8 的残差网络能够恢复泛化,表明深度需要架构性稳定性;(2)**Transformer 与 MLP 之间的显著差距在匹配超参数后几乎消失**(1.11 倍的延迟),表明先前报告的差异主要归因于优化器和正则化的混淆;(3)**激活函数的效果取决于具体情境**,仅当正则化允许记忆时,GELU 相较于 ReLU 快高达 4.3 倍;(4)**权重衰减是决定性控制参数**,呈现狭窄的“金色区”(Goldilocks 区间),仅在该区间内才能实现 grokking,而过少或过多都会阻碍泛化。在每个配置下进行 3-5 次随机种子实验,这些结果提供了对 grokking 作为一种相互作用驱动现象的统一经验解释。我们的发现挑战了以架构为中心的解释,阐明了优化与正则化如何共同支配延迟泛化。
引用
@article{arxiv.2603.25009,
title = {A Systematic Empirical Study of Grokking: Depth, Architecture, Activation, and Regularization},
author = {Shalima Binta Manir and Anamika Paul Rupa},
journal= {arXiv preprint arXiv:2603.25009},
year = {2026}
}