超越理想:分析不精确的 muon 更新
机器学习
2025-10-24 v1 最优化与控制
摘要
Muon 优化器已迅速成为一种强大的、几何感知的 AdamW 替代方案,在神经网络的大规模训练中展现出卓越的性能。然而存在一个关键的理论与实践之间的断层:Muon 的效率依赖于快速、近似的正交化,而所有先前的理论工作都分析了一个理想化的、计算上不可实现的版本,假设使用精确的 SVD-based 更新。本工作超越了理想化版本,首次分析了 Muon 核心中不精确正交化更新。我们在线性最小化oracle (LMO) 基于优化的通用框架内发展了我们的分析,引入了现实主义的加法误差模型来捕捉实际近似方案的不精确性。我们的分析得到了显式的界限,量化了作为 LMO 不精确性/误差函数的性能降低。我们揭示了这种不精确性与最优步长和动量之间的根本性的耦合:oracle 的精度较低需要更小的步长,但更大的动量参数。这些发现将近似过程(例如 Newton-Schulz 步数)从一个实现细节提升为必须与学习计划共同调谐的关键参数。NanoGPT 实验直接确认了预测的耦合,随着近似精度的变化,最优学习率明显偏移。
关键词
引用
@article{arxiv.2510.19933,
title = {Beyond the Ideal: Analyzing the Inexact Muon Update},
author = {Egor Shulgin and Sultan AlRashed and Francesco Orabona and Peter Richtárik},
journal= {arXiv preprint arXiv:2510.19933},
year = {2025}
}