中文

非欧梯度下降的探索:Muon及其众多变体

机器学习 2025-10-14 v1 机器学习

摘要

要在神经网络中定义最速下降法,我们需要为每一层选择一个范数、一种跨层聚合这些范数的方式,以及是否使用归一化。我们系统地探索了跨层聚合范数的不同替代方案,既将Adam与最近提出的Muon的现有组合形式化为一种非欧梯度下降类型,又推导出Muon优化器的新变体。通过对我们框架内各优化器进行全面实验评估,我们发现Muon对学习率的选择敏感,而我们称之为MuonMax的新变体则显著更为稳健。随后我们展示了如何将任意非欧梯度方法与基于模型的动量(即Momo)相结合。Muon的Momo新变体对超参数调优显著更为稳健,且通常能获得更好的验证分数。因此,对于最优超参数未知的新任务,我们建议将Momo与MuonMax结合使用,以节省昂贵的超参数调优成本。

关键词

引用

@article{arxiv.2510.09827,
  title  = {An Exploration of Non-Euclidean Gradient Descent: Muon and its Many Variants},
  author = {Michael Crawshaw and Chirag Modi and Mingrui Liu and Robert M. Gower},
  journal= {arXiv preprint arXiv:2510.09827},
  year   = {2025}
}