Muon在尾端联想记忆学习中优于Adam
机器学习
2025-10-07 v2 人工智能
最优化与控制
摘要
Muon优化器在训练大型语言模型时始终比Adam更快,但其成功背后的机制仍不清楚。本文通过联想记忆的视角揭示了这一机制。通过消融由Muon优化的Transformer组件,我们揭示了大语言模型的联想记忆参数,即Value和Output注意力权重以及前馈网络,是Muon优越性的主要贡献者。受此联想记忆视角的启发,我们随后解释了Muon在现实世界语料库上的优越性,这些语料库本质上是重尾分布的:少数类别(尾类别)出现的频率远低于其他类别。这种优越性通过两个关键特性来解释:(i) 其更新规则始终产生比Adam更各向同性的奇异谱;因此,(ii) 在重尾数据上,它比Adam更有效地优化尾类别。除了经验证据外,我们通过分析类别不平衡数据下的单层联想记忆模型,从理论上证实了这些发现。我们证明,无论特征嵌入如何,Muon都能一致地实现跨类别的平衡学习,而Adam则可能根据嵌入属性导致学习误差的巨大差异。总之,我们的经验观察和理论分析揭示了Muon的核心优势:其更新规则与线性联想记忆的外积结构对齐,从而在重尾分布中实现比Adam更平衡、更有效的尾类别学习。
引用
@article{arxiv.2509.26030,
title = {Muon Outperforms Adam in Tail-End Associative Memory Learning},
author = {Shuche Wang and Fengzhuo Zhang and Jiaxiang Li and Cunxiao Du and Chao Du and Tianyu Pang and Zhuoran Yang and Mingyi Hong and Vincent Y. F. Tan},
journal= {arXiv preprint arXiv:2509.26030},
year = {2025}
}