中文

Muon 优化器状态的有效量化

机器学习 2026-02-24 v3

摘要

基于矩阵正交化的 Muon 优化器,最近在 LLM 预训练中显示出比 AdamW 更快的收敛速度和更好的计算效率。然而,维护高精度优化器状态的内存开销仍然是大规模部署的一个挑战。在本文中,我们引入了使用分块量化的 8 位 Muon 优化器。在对高达 2.7B 大小的模型进行预训练并对其进行指令遵循微调的广泛 Chinchilla 最优实验中,我们证明 8 位 Muon 在验证损失和下游基准测试方面与 Muon 达到同等水平,同时将优化器状态占用减少了高达 62%。至关重要的是,我们表明 Muon 的更新机制与简单的线性量化方案具有独特的兼容性,绕过了量化 AdamW 所需的复杂动态缩放。我们用对 Muon 对量化噪声鲁棒性的理论分析补充了我们的经验发现。

关键词

引用

@article{arxiv.2509.23106,
  title  = {Effective Quantization of Muon Optimizer States},
  author = {Aman Gupta and Rafael Celente and Abhishek Shivanna and D. T. Braithwaite and Gregory Dexter and Shao Tang and Hiroto Udagawa and Daniel Silva and Rohan Ramanath and S. Sathiya Keerthi},
  journal= {arXiv preprint arXiv:2509.23106},
  year   = {2026}
}

备注

16 pages