平等梯度下降:加速 Grokking 的简单方法
机器学习
2026-05-19 v3
摘要
Grokking 是一种现象:与训练表现不同,模型的测试/泛化性能在训练过程中保持停滞数个 epoch,然后突然跳到通常接近完美的水平。在实际中,减少此类停滞长度(即使模型更快地“grok”)是有希望的。在本工作中,我们对 grokking 提供了新见解。首先,我们证明了通过不对称速度进行(随机)梯度下降可以诱导 grokking,这些速度在梯度的不同主方向(即奇异方向)上不一致。随后,我们提出一种简单修改,使所有主方向的动力学速度恰好相同。然后,我们证明了该修改方法(称为平等梯度下降 EGD,可视为对然然梯度下降的精心修改)能够显著加快 grokking速度。事实上,在某些情况下,停滞被完全消除。最后,我们在经典算术问题(如模块加法和稀疏奇偶校验问题)上进行实验,这些问题已广泛观察并深入研究此停滞。我们的 proposed 方法消除了这些停滞。
引用
@article{arxiv.2510.04930,
title = {Egalitarian Gradient Descent: A Simple Approach to Accelerated Grokking},
author = {Ali Saheb Pasand and Elvis Dohmatob},
journal= {arXiv preprint arXiv:2510.04930},
year = {2026}
}