中文

MONA:用于可扩展语言模型训练的穆翁优化器 with Nesterov 加速

机器学习 2026-05-27 v1 计算与语言

摘要

穆翁(Muon)优化器最近作为大型语言模型训练中对抗 AdamW 的有前景的替代方案,利用矩阵正交化产生几何感知的更新。然而,像所有一阶方法一样,Muon 可能陷入尖锐局部极小值中。本文我们提出了 MONA,一种将穆翁的正交化框架与曲率感知加速相结合的优化器。MONA 直接将加速项纳入穆翁的梯度处理管道中。该项计算自梯度差值的指数移动平均。我们为 MONA 提供了详细的收敛分析,表明加速项使优化器能够脱离尖锐极小值,同时保持穆翁的谱范数正则化。实验表明,MONA 在三个规模的 Mixture-of-Experts 预训练中(从 10 亿到 680 亿参数),在从早期 encoder-decoder 架构到现代大型语言模型的多个模型上,实现了更好的收敛和下游任务性能。此外,我们对 MOE-68B-A3B 模型进行了监督式微调,在一般能力、数学推理和代码生成基准测试中实现了 SOTA 性能。

关键词

引用

@article{arxiv.2605.26842,
  title  = {MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training},
  author = {Jiacheng Li and Jianchao Tan and Hongtao Xu and Jiaqi Zhang and Yifan Lu and Yerui Sun and Yuchen Xie and Xunliang Cai},
  journal= {arXiv preprint arXiv:2605.26842},
  year   = {2026}
}