MuonAll:用于高效微调大型语言模型的 Muon 变体
计算与语言
2025-11-11 v1 机器学习
摘要
Muon 优化器在语言模型预训练中展现出稳健的性能,但其在现有公开预训练模型的微调领域尚未得到探索。目前,Muon 与 AdamW 联合使用时,仅能在 Muon 内部参数范围内获得改进。我们提出 MuonAll,通过转换为 2D 矩阵的方式将所有参数纳入 Muon 框架。我们在规模达到半亿参数的多个公开语言模型上进行了大规模微调实验。Muon 和 MuonAll 在主要基准测试上与 AdamW 表现相当,凸显其作为替代优化器的有效性。我们开源了 Muon 和 MuonAll 的分布式实现,地址为 https://github.com/Saurabh750/optimizer
引用
@article{arxiv.2511.06086,
title = {MuonAll: Muon Variant for Efficient Finetuning of Large Language Models},
author = {Saurabh Page and Advait Joshi and S. S. Sonawane},
journal= {arXiv preprint arXiv:2511.06086},
year = {2025}
}