Grokking 是一种计算玻璃弛豫吗?
机器学习
2026-01-06 v5 无序系统与神经网络
摘要
理解神经网络(NN)的泛化能力仍是深度学习研究的核心问题。Grokking 这一特殊现象——即神经网络在训练性能达到近乎完美水平很久之后突然泛化——为探究神经网络泛化能力的底层机制提供了一个独特窗口。在此,我们提出一种对 grokking 的解释,将其框架化为计算玻璃弛豫:将神经网络视为一个物理系统,其中参数为自由度,训练损失为系统能量,我们发现记忆过程类似于液体在低温下快速冷却进入非平衡玻璃态,而随后的泛化则类似于向更稳定构型的缓慢弛豫。这种映射使我们能够采样神经网络的玻尔兹曼熵(状态密度)景观,作为训练损失和测试准确率的函数。我们在 Transformer 上进行的算术任务实验表明,在 grokking 的记忆到泛化转变中不存在熵垒,这挑战了先前将 grokking 定义为一级相变的理论。我们识别出 grokking 下的高熵优势,这是对先前将熵与泛化能力联系起来的工作的扩展,但意义更为重大。受 grokking 的远离平衡态特性启发,我们基于 Wang-Landau 分子动力学开发了一个玩具优化器 WanD,它可以在没有任何约束的情况下消除 grokking,并找到高范数泛化解。这为将 grokking 仅归因于权重范数向 Goldilocks 区域演化的理论提供了严格定义的反例,并为优化器设计提供了新的潜在途径。
引用
@article{arxiv.2505.11411,
title = {Is Grokking a Computational Glass Relaxation?},
author = {Xiaotian Zhang and Yue Shang and Entao Yang and Ge Zhang},
journal= {arXiv preprint arXiv:2505.11411},
year = {2026}
}