Muown:行范数控制下的 Muon 优化
机器学习
2026-05-12 v1
摘要
Muon 已成为语言模型预训练中与 AdamW 竞争的强劲选择,但其在大规模下的行为对权重衰减敏感。近期研究发现,在无解耦权重衰减的情况下,Muon 的权重矩阵谱范数在训练期间会持续上升。通过将谱范数分解为行幅值因子与行相关性因子,我们识别出前者是该漂移的经验驱动因素,而后者在轨迹沿线保持良好行为。基于此诊断,我们引入 Muown,作为 Muon 的即插即用替代方案,将行幅值向量作为显式优化变量,在分解引导的 几何下更新,同时对剩余方向分量保持不变的 Muon。我们证明 Muown 在与底层几何对齐的双范数下,在确定性和随机 regime 下均达到最优非凸收敛率,并在经验上显示其随机噪声系数始终低于 Muon。在从 124M 至 27B 参数的 GPT 结构预训练中,Muown 在 perplexity 上优于 Muon、SOAP、AdamW 和 Lion。它还扩宽了跨模型规模的近最优学习率 plateau,降低了对权重衰减的敏感性,并在适当分片的情况下以可忽略的步骤时间开销避免了谱范数漂移。
引用
@article{arxiv.2605.10797,
title = {Muown: Row-Norm Control for Muon Optimization},
author = {Kai Lion and Florian Hübler and Bingcong Li and Antonio Orvieto and Niao He},
journal= {arXiv preprint arXiv:2605.10797},
year = {2026}
}