NorMuon:提高 Muon 优化器的效率与可扩展性
机器学习
2025-10-08 v1 计算与语言
摘要
优化器的选择显著影响大型语言模型(LLM)的训练效率和计算成本。最近,Muon 优化器通过对参数更新进行正交化,改进了优化几何,从而展现出前景广阔的性能。尽管 Muon 作为 Adam 的有力继任者不断涌现,但系统性地探索两者优势的联合潜力尚未完成。本文通过提出 NorMuon(Neuron-wise Normalized Muon),一种融合正交化与神经元级自适应学习率的优化器,弥合了这一鸿沟。我们的分析表明,虽然 Muon 有效降低了条件数,但其结果更新显示出高度非均匀的神经元范数,导致某些神经元主导优化过程。NorMuon 通过为每个神经元维持二阶动量统计,并在正交化后应用行级归一化,从而解决了这种不平衡,确保参数利用的均衡,同时保留 Muon 的条件改善效果。为实现大规模部署,我们开发了基于 FSDP2 框架的高效分布式实现, strategically 将正交化计算跨越设备。跨多个模型规模的实验表明,NorMuon 在所有情况下都一致优于 Adam 和 Muon,在 11 亿参数的预训练设置下,相较于 Adam 提升训练效率 21.74%,相较于 Muon 提升 11.31%,同时保持与 Muon 相当的内存占用。我们的发现表明,正交化与自适应学习率是互补而非竞争的技术,为大规模深度学习中的优化器设计开辟了新的方向。
引用
@article{arxiv.2510.05491,
title = {NorMuon: Making Muon more efficient and scalable},
author = {Zichong Li and Liming Liu and Chen Liang and Weizhu Chen and Tuo Zhao},
journal= {arXiv preprint arXiv:2510.05491},
year = {2025}
}