中文

权重衰减在学习率迁移中的作用可能比 muP 更为关键

机器学习 2026-02-16 v2

摘要

将小型神经网络的最优学习率迁移到大型网络上,可以在难以进行超参数调优的规模范围内实现高效训练。为此,最大更新参数化(muP)提出了一种学习率缩放方案,旨在保持不同模型宽度下内部表示的更新动力学稳定。然而,muP的缩放规则依赖于关于图层输入与其权重及梯度更新之间几何对齐的强假设。在本大规模实证研究中,我们表明,这些假设仅在学习率迁移最有价值的实际场景(如大型语言模型训练)的训练开始时短暂成立。在训练的其余阶段,权重衰减而非muP才正确稳定了不同宽度下内部表示的更新动力学,从而实现学习率迁移。这表明muP的缩放主要充当了一种隐式学习率 warmup 机制,我们可以大大取代其为修改后的 warmup 方案。结合这些发现,本研究从根本上挑战了关于学习率迁移的主流观念,并可解释为何muP需要独立的权重衰减变体才能实现良好迁移的实证观察。

关键词

引用

@article{arxiv.2510.19093,
  title  = {Weight Decay may matter more than muP for Learning Rate Transfer in Practice},
  author = {Atli Kosson and Jeremy Welborn and Yang Liu and Martin Jaggi and Xi Chen},
  journal= {arXiv preprint arXiv:2510.19093},
  year   = {2026}
}

备注

ICLR 2026