中文

NeuralGrok:通过神经梯度转换加速Grokking

机器学习 2025-04-28 v2 人工智能

摘要

Grokking是一种在过拟合后长期后期实现泛化的现象,广泛应用于Transformer模型的算术任务中。本文提出NeuralGrok—a novel基于梯度的方法,通过学习最优梯度转换加速Transformer在算术任务中的泛化。具体而言,NeuralGrok训练一个辅助模块(如MLP块)与基础模型并行,动态调制individual梯度分量的影响,依据其对泛化的贡献进行引导,采用双层优化算法。我们的大量实验表明,NeuralGrok显著加速了泛化,尤其是在具有挑战性的算术任务中。我们还展示NeuralGrok促进更稳定的训练范式,不断降低模型复杂度,而传统正则化方法如权重衰减会引入显著不稳定性并阻碍泛化。我们进一步利用一种新颖的绝对梯度熵(AGE)度量探讨模型内在复杂度,阐明NeuralGrok通过降低模型复杂度有效促进了泛化。我们为Transformer模型的Grokking现象提供了宝贵的洞见,鼓励深入理解支配泛化能力的基本原理。

关键词

引用

@article{arxiv.2504.17243,
  title  = {NeuralGrok: Accelerate Grokking by Neural Gradient Transformation},
  author = {Xinyu Zhou and Simin Fan and Martin Jaggi and Jie Fu},
  journal= {arXiv preprint arXiv:2504.17243},
  year   = {2025}
}

备注

Preprint, 16 pages