中文

Turbo-Muon:通过预条件化加速正交化优化

人工智能 2025-12-05 v1

摘要

正交化优化器,如 Muon,最近在大规模训练和社区驱动的效率挑战中表现突出。然而,这些方法依赖于代价高昂的梯度正交化步骤。即使是像 Newton-Schulz 这样的高效迭代近似方法,也通常需要数十次矩阵乘法才能收敛。我们引入一种预条件化程序,可加速 Newton-Schulz 的收敛并降低其计算成本。我们评估了其影响,表明我们的预条件化开销可以被压制到可忽略的水平。此外,它所 enabled 的更快收敛允许我们在不损害近似质量的情况下去掉一次通常需要的五次迭代。我们的公开实现在 Newton-Schulz 近似中实现了最高可达 2.8 倍的加速。我们也展示,这直接影响端到端训练运行时间,在两个以效率为导向的任务中实现 5-10% 的运行时改进。在具有挑战性的语言或视觉任务上,我们验证该方法在保持等或更好模型性能的同时提高了运行时间。关键的是,这些改进无需超参数调优即可作为简单的即插即用替换。我们的 code 在 github 上公开可用。

关键词

引用

@article{arxiv.2512.04632,
  title  = {Turbo-Muon: Accelerating Orthogonality-Based Optimization with Pre-Conditioning},
  author = {Thibaut Boissin and Thomas Massena and Franck Mamalet and Mathieu Serrurier},
  journal= {arXiv preprint arXiv:2512.04632},
  year   = {2025}
}