中文

Variance-Adaptive Muon:基于 NSR 调制和方差缩放动量加速 LLM 预训练

机器学习 2026-01-22 v1

摘要

大型语言模型 (LLM) 在多样化的自然语言处理 (NLP) 任务上实现了具竞争力的性能,但预训练计算成本高昂,使优化器效率成为重要的实用考量。Muon 通过正交动量更新加速 LLM 预训练,这种更新方式是元素级 sign 运算的矩阵类比。灵感来源于最近的观点认为 Adam 是一种方差自适应 sign 更新算法,我们提出了两种 Muon 变体:Muon-NSR 和 Muon-VS,分别在正交化之前对动量应用方差自适应归一化。Muon-NSR 采用噪声到信号比 (NSR) 调制,而 Muon-VS 则在不引入额外超参数的前提下进行方差基准缩放。在 GPT-2 和 LLaMA 预训练实验中,我们的方法实现了收敛加速,并始终优于竞争的、经过精心调优的 AdamW 和 Muon 基线。例如,在 LLaMA-1.2B 模型上,Muon-NSR 和 Muon-VS 相对于经过最近基准测试调优的 Muon 所需迭代次数分别减少了 1.36×1.36\times

关键词

引用

@article{arxiv.2601.14603,
  title  = {Variance-Adaptive Muon: Accelerating LLM Pretraining with NSR-Modulated and Variance-Scaled Momentum},
  author = {Jingru Li and Yibo Fan and Huan Li},
  journal= {arXiv preprint arXiv:2601.14603},
  year   = {2026}
}