中文

Muon 在预训练中的实际效率

机器学习 2025-05-21 v4 机器学习

摘要

我们证明,Muon 作为二阶优化器的最简单实例,在计算时间权衡方面明确扩展了相对于 AdamW 的帕累托前沿。我们发现,在大批量大小下,Muon 在保持数据效率方面比 AdamW 更有效,远超所谓的临界批量大小,同时保持计算效率,从而实现更经济的训练。我们研究了 Muon 与最大更新参数化 (muP) 的结合,以实现高效的超参数迁移,并提出了一种简单的伸缩算法,该算法考虑了 muP 中的所有误差源,同时仅引入适度的资源开销。我们通过模型规模高达 40 亿参数的广泛实验以及对数据分布和架构的消融研究,验证了我们的发现。

关键词

引用

@article{arxiv.2505.02222,
  title  = {Practical Efficiency of Muon for Pretraining},
  author = {Essential AI and : and Ishaan Shah and Anthony M. Polloreno and Karl Stratos and Philip Monk and Adarsh Chaluvaraju and Andrew Hojel and Andrew Ma and Anil Thomas and Ashish Tanwer and Darsh J Shah and Khoi Nguyen and Kurt Smith and Michael Callahan and Michael Pust and Mohit Parmar and Peter Rushton and Platon Mazarakis and Ritvik Kapila and Saurabh Srivastava and Somanshu Singla and Tim Romanski and Yash Vanjani and Ashish Vaswani},
  journal= {arXiv preprint arXiv:2505.02222},
  year   = {2025}
}