中文

借助弱模型的嵌入迁移加速 Grokking

机器学习 2025-04-21 v1 机器学习

摘要

“Grokking” 是一种现象,即神经网络首先记忆训练数据并泛化较差,但随后在长期训练后突然转向近乎完美的泛化。尽管这一现象引人入胜,但这种延迟泛化现象会损害可预测性和效率。理想情况下,模型应直接实现泛化而无需延迟。为此,本文提出了 GrokTransfer 方法,用于加速神经网络训练中的 Grokking,这种方法基于数据嵌入在决定泛化是否延迟方面起关键作用的观察。GrokTransfer 首先训练一个较小且较弱的模型以达到非平凡(但远非最优)的测试性能,然后提取该弱模型所学习的输入嵌入,并用于初始化目标更强模型中的嵌入。我们对在合成 XOR 任务上进行的严格证明表明,GrokTransfer 使目标模型能够在常规训练中始终发生延迟泛化的情形下,直接实现泛化。此外,我们在不同任务的实证研究中展示了,GrokTransfer 有效重塑了训练动力学,消除了延迟泛化,对完全连接的神经网络和 Transformer 均有效。

关键词

引用

@article{arxiv.2504.13292,
  title  = {Let Me Grok for You: Accelerating Grokking via Embedding Transfer from a Weaker Model},
  author = {Zhiwei Xu and Zhiyu Ni and Yixin Wang and Wei Hu},
  journal= {arXiv preprint arXiv:2504.13292},
  year   = {2025}
}

备注

ICLR 2025