中文

Grokking 还是 Glitching?低精度如何驱动 Slingshot 损失尖峰

机器学习 2026-05-27 v3 计算与语言 最优化与控制 机器学习

摘要

深度神经网络在无正则化长期训练期间表现出周期性的损失尖峰,这种现象被称为“Slingshot 机制”。现有工作通常将其归因于内在的优化动力学,但其触发机制仍不清楚。本文证明该现象是浮点算术精度限制的结果。随着训练进入高置信度阶段,正确类 logit 与其他 logit 之间的差异可能超过吸收误差阈值。随后在反向传播期间,正确类的梯度被精确舍入为零,而错误类的梯度保持非零。这破坏了各类之间梯度的零和约束,并在分类器层的参数更新中引入了系统性漂移。我们证明该漂移与特征形成正反馈循环,导致全局分类器均值和全局特征均值呈指数增长。我们将此机制称为数值特征膨胀。该机制解释了 Slingshot 尖峰前的范数快速增长、随后梯度的重新出现以及由此产生的损失尖峰。我们进一步表明,NFI 并不等同于观察到的损失尖峰:在更实际的任务中,部分吸收可能不会产生可见的尖峰,但它仍然可以破坏零和约束并驱动参数范数的快速增长。我们的结果将 Slingshot 重新解释为有限精度训练的数值动力学,并为训练后期的异常参数增长和 logit 发散提供了可测试的解释。

关键词

引用

@article{arxiv.2605.06152,
  title  = {Grokking or Glitching? How Low-Precision Drives Slingshot Loss Spikes},
  author = {Liu Hanqing and Jianjun Cao and Yuanze Li and Zijian Zhou},
  journal= {arXiv preprint arXiv:2605.06152},
  year   = {2026}
}

备注

28 pages, 13 figures; ICML 2026 Workshop on High-dimensional Learning Dynamics (Spotlight)