LionMuon:交替谱下降与符号下降实现高效训练
机器学习
2026-05-20 v1
摘要
在大规模优化中,更新步骤的低成本与有效性是优化器成功的最关键因素。基于符号的优化器(如 Lion 或 Signum)产生每步成本低廉的更新,而 Muon 的谱矩阵符号更新则以显著更高的每步成本提供更强的方向。本文提出 LionMuon,它在保留 Muon 步骤有效性的同时,大幅降低了平均迭代成本,与基于符号的方法相近。它在一个固定周期 P 上交替使用 Lion 和 Muon 的更新,并在两者之间共享一个双指数移动平均(dual-EMA)动量缓冲区。因此,优化器状态内存与 Lion 相当,恰好是 AdamW 的一半。一种更简单的单指数移动平均变体 SignMuon,其自身性能已优于纯 Muon。在 P = 2 时,LionMuon 在我们测试的 1.24 亿参数规模的所有数据集和架构上,均帕累托优于 Muon、Lion、Signum 和 AdamW,以更低的计算量达到更低的验证损失,并且这一优势在 3.55 亿和 7.2 亿参数规模上持续存在。在理论方面,我们在重尾噪声下证明了严格的复杂度界限,该界限由周期平均平滑度和噪声决定,并在 Muon 和 Lion 的常数之间进行插值。这些界限预测了计算最优周期以及 LionMuon 超越 Muon 和 Lion 的条件。代码:https://github.com/brain-lab-research/lion-muon
引用
@article{arxiv.2605.19811,
title = {LionMuon: Alternating Spectral and Sign Descent for Efficient Training},
author = {Arman Bolatov and Artem Riabinin and Nikita Kornilov and Andrey Veprikov and Samuel Horváth and Martin Takáč and Aleksandr Beznosikov},
journal= {arXiv preprint arXiv:2605.19811},
year = {2026}
}
备注
38 pages, 13 figures, 4 tables