中文

是否使用 Muon:优化器中简单偏置的影响

机器学习 2026-03-03 v1

摘要

长期以来,Adam 一直是训练深度神经网络的事实标准默认选择。最近,许多新的优化器被引入,其中 Muon 或许因其卓越的训练速度而获得最高的流行度。虽然许多论文旨在验证 Muon 的优势,但我们的论文探讨了这种加速背后机制所带来的潜在缺点。我们探讨了使用 Muon 优化时所引入的偏置,提供了理论分析并阐述了其对学习轨迹和所学解答的影响。虽然理论确实为 Muon 所带来的优势提供了依据,但也指导了我们构想出几个示例,其中 Muon 优化的模型存在缺点。我们强调的核心问题是,Muon 优化消除了由经典更为详尽研究的方法(如随机梯度下降 SGD)天然保留的简单偏置。我们对这一可能性的后果采取了初步步骤以进行理解:Muon 可能在发现任务之间常见的底层结构方面困难重重,更容易拟合虚假特征。更广泛地说,本文应作为提醒:在开发新优化器时,必须考虑其所引入的偏置,因为这些偏置可能根本性地改变模型的行为——无论是更好还是更差。

关键词

引用

@article{arxiv.2603.00742,
  title  = {To Use or not to Use Muon: How Simplicity Bias in Optimizers Matters},
  author = {Sara Dragutinović and Rajesh Ranganath},
  journal= {arXiv preprint arXiv:2603.00742},
  year   = {2026}
}