Gluon:让 Muon 与 Scion 重获新生!(LMO 基础优化器在 LLM 中的理论与实践桥梁)
机器学习
2025-05-20 v1 最优化与控制
机器学习
摘要
深度学习优化的最新发展带来了基于线性最小化预言机(LMO)框架的全新算法,如 Muon 和 Scion。在 Adam 主导十多年后,这些基于 LMO 的方法正作为可行的替代方案出现,提供若干实际优势,如改进的内存效率、更好的超参数可迁移性,以及最重要的是,在大规模任务(包括 LLM 训练)上的优越经验性能。然而,它们的实际使用与当前理论理解之间仍存在显著差距:先前的分析(1)忽略了这些优化器在实践中的逐层 LMO 应用,(2)依赖于不切实际的光滑性假设,导致实际步长过小。为了解决这两个问题,我们提出一种新的基于 LMO 的方法 Gluon,将先前理论分析的方法捕获为特例,并引入一种新的精炼广义光滑模型,捕捉神经网络的逐层几何结构,匹配 Muon 和 Scion 的逐层实际实现,并给出具有强实际预测能力的收敛保证。与先前结果不同,我们的理论步长与 Pethick 等人(2025)报告的微调值紧密匹配。我们在 NanoGPT 和 CNN 上的实验证实我们的假设沿优化轨迹成立,最终弥合了理论与实践之间的差距。
引用
@article{arxiv.2505.13416,
title = {Gluon: Making Muon & Scion Great Again! (Bridging Theory and Practice of LMO-based Optimizers for LLMs)},
author = {Artem Riabinin and Egor Shulgin and Kaja Gruntkowska and Peter Richtárik},
journal= {arXiv preprint arXiv:2505.13416},
year = {2025}
}