中文

可学习乘子:释放语言模型矩阵层的尺度

机器学习 2026-01-09 v1

摘要

对矩阵层应用权重衰减(WD)是大语言模型预训练中的标准做法。先前的研究表明,随机梯度噪声会导致权重矩阵W发生类似布朗运动的膨胀,其增长被WD所抵消,从而形成具有特定权重范数||W||的WD-噪声平衡。在这项工作中,我们将该平衡范数视为训练过程的有害产物,并通过引入可学习乘子来学习最优尺度来解决此问题。首先,我们为W附加一个可学习的标量乘子,并确认WD-噪声平衡范数是次优的:学习到的尺度能适应数据并提升性能。然后,我们认为单个行和列范数同样受到约束,并通过引入可学习的逐行和逐列乘子来释放其尺度。我们的方法可被视为muP乘子的一个可学习、更具表达力的泛化。它优于经过良好调优的muP基线,减少了乘子调优的计算开销,并揭示了诸如前向传递对称性和学习到的乘子的宽度缩放等实际问题。最后,我们使用Adam和Muon优化器验证了可学习乘子,其在下游评估中的改进与从Adam切换到Muon所带来的改进相当。

关键词

引用

@article{arxiv.2601.04890,
  title  = {Learnable Multipliers: Freeing the Scale of Language Model Matrix Layers},
  author = {Maksim Velikanov and Ilyas Chahed and Jingwei Zuo and Dhia Eddine Rhaiem and Younes Belkada and Hakim Hacid},
  journal= {arXiv preprint arXiv:2601.04890},
  year   = {2026}
}