中文

MARS-M:方差归约与矩阵的结合

机器学习 2026-02-02 v3 最优化与控制 机器学习

摘要

基于矩阵的预条件优化器,如 Muon,最近的研究表明在训练大规模神经网络(包括大型语言模型, LLM)时更为高效,而标量型优化器则不具备同样的效果。近期的 LLM 预训练优化器基准研究显示,诸如 MARS 之类的方差归约技术可显著加快训练速度,相较于不采用方差归约的标准优化器。本文引入了 MARS-M,这是一种新的优化器,将 MARS 风格的方差归约与 Muon 集成在一起。在标准正则性条件下,我们证明了 MARS-M 以 O~(T1/3)\tilde{\mathcal{O}}(T^{-1/3}) 的收敛率达到一阶稳定点,优于 Muon 的 O~(T1/4)\tilde{\mathcal{O}}(T^{-1/4}) 收敛率。在语言建模和计算机视觉任务上的实验结果表明,MARS-M 在各种下游基准测试中 consistently 获得更低的损失并表现出更佳的性能。MARS-M 的实现已公开于 https://github.com/AGI-Arena/MARS/tree/main/MARS_M。

关键词

引用

@article{arxiv.2510.21800,
  title  = {MARS-M: When Variance Reduction Meets Matrices},
  author = {Yifeng Liu and Angela Yuan and Quanquan Gu},
  journal= {arXiv preprint arXiv:2510.21800},
  year   = {2026}
}