中文

关联记忆学习中的Muon优化器:训练动力学与缩放规律

机器学习 2026-05-26 v2 最优化与控制 机器学习

摘要

Muon通过梯度的矩阵符号更新矩阵参数,并显示出强大的经验收益,但其动力学和缩放行为在理论上仍不清楚。我们在具有softmax检索和查询-答案对上的层次频率谱的线性关联记忆模型中研究Muon,包括有标签噪声和无标签噪声的情况。在此设置中,我们表明梯度下降(GD)以高度不平衡的速率学习频率分量,导致收敛缓慢,受限于低频分量。相比之下,Muon优化器缓解了这种不平衡,实现了更快、更均匀的进展。具体而言,在无噪声情况下,Muon比GD实现了指数级加速;在具有幂律频率谱的有噪声情况下,我们推导了Muon的缩放规律,并展示了其优于GD的缩放效率。此外,我们表明Muon可以被解释为由自适应任务对齐和块对称梯度结构产生的隐式矩阵预处理器。相比之下,具有坐标符号算子的预处理器在获得未知任务表示的oracle访问权限时可以匹配Muon,这在实践中对于SignGD是不可行的。在合成长尾分类和LLaMA风格预训练上的实验证实了该理论。

关键词

引用

@article{arxiv.2602.05725,
  title  = {Muon in Associative Memory Learning: Training Dynamics and Scaling Laws},
  author = {Binghui Li and Kaifei Wang and Han Zhong and Pinyan Lu and Liwei Wang},
  journal= {arXiv preprint arXiv:2602.05725},
  year   = {2026}
}

备注

Published as a conference paper at ICML 2026; 53 pages