中文

关于预条件化梯度下降在丰富学习范型中的收敛行为

机器学习 2026-05-08 v2

摘要

谱偏移是神经网络首先学习低频率的倾向,这既是一种祝福也是一种诅咒。虽然它通过抑制高频噪声来增强泛化能力,但在需要捕捉细粒度结构的科学任务中可能构成限制。已知的延迟泛化现象“grokking”是神经网络快速训练的另一个障碍。grokking 被假设为源于学习从 NTK 向特征丰富范型的转换。本文探讨了预条件化梯度下降 (PGD) 如高斯牛顿法对谱偏移和 grokking 现象的影响。我们通过理论和实证结果展示,PGD 如何缓解谱偏移相关的局限性。此外,基于丰富学习范型的 grokking 假设,我们研究了 PGD 如何用于减少 grokking 的延迟。我们的假设是,PGD 在没有谱偏移的阻碍下,能够在 NTK 范型中均匀探索参数空间。我们的实验结果确认了这一预测,为 grokking 表示为 NTK 与丰富范型之间过渡行为提供了强有力的证据。这些发现深化了我们对优化动力学、谱偏移以及神经网络学习相位之间相互作用的理解。

关键词

引用

@article{arxiv.2601.03162,
  title  = {On the Convergence Behavior of Preconditioned Gradient Descent Toward the Rich Learning Regime},
  author = {Shuai Jiang and Alexey Voronin and Eric Cyr and Ben Southworth},
  journal= {arXiv preprint arXiv:2601.03162},
  year   = {2026}
}

备注

21 pages, 13 figures,