中文

MiMuon:混合 Muon 优化器及其在大模型中的改进泛化

机器学习 2026-05-20 v1 人工智能 最优化与控制 机器学习

摘要

矩阵结构的参数频繁出现在许多人工智能模型中,如大型语言模型。最近设计了一种针对大规模模型矩阵参数的高效 Muon 优化器,显示出显著 faster 收敛于向量级算法。虽然一些工作开始研究 Muon 优化器的收敛性 (即优化误差),但其泛化性 (即泛化误差) 仍未得到界定。因此,本文基于算法稳定性和数学归纳法研究了 Muon 优化器的泛化误差,证明了 Muon 的泛化误差为 O(1NκT)O\big(\frac{1}{N\kappa^{T}}\big),其中 NN 为训练样本规模,TT 表示迭代次数,κ>0\kappa>0 表示梯度估计奇异值之间最小差异。为增强 Muon 的泛化性,我们提出了一种有效的混合 Muon (MiMuon) 优化器,通过谨慎使用梯度正交化实现,作为 Muon 和基于动量的 SGD 优化器的混合。我们证明了我们的 MiMuon 优化器的泛化误差为 O(1N)O\big(\frac{1}{N}\big),因为 κ\kappa 通常非常小。我们也研究了 MiMuon 算法的收敛性,证明了我们的 MiMuon 算法具有与 Muon 算法相同的收敛率 O(1T1/4)O(\frac{1}{T^{1/4}})。一些在训练大型模型(包括 Qwen3-0.6B 和 YOLO26m)上的数值实验结果表明了 MiMuon 优化器的有效性。

关键词

引用

@article{arxiv.2605.19619,
  title  = {MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models},
  author = {Feihu Huang and Yuning Luo and Songcan Chen},
  journal= {arXiv preprint arXiv:2605.19619},
  year   = {2026}
}

备注

25 pages