中文

Muon 等方法的误差反馈

机器学习 2025-10-02 v1 最优化与控制 机器学习

摘要

最近的优化器如 Muon、Scion 和 Gluon 通过利用对非欧几里得范数球的层级线性最小化oracle (LMO) 推动了大规模深度学习的前沿,捕捉了神经网络结构,这是传统算法所不能够做到的。然而,这些方法尚不存在原则性的分布式框架,通信瓶颈仍未得到解决。少数几种分布式变体是经验性的,毫无收敛保证。我们引入了 EF21-Muon,这是第一个具有严格收敛保证的、通信高效的、非欧几里得 LMO 基于优化器。EF21-Muon 支持随机梯度、动量和双向压缩,以及误差反馈标记——这是对误差反馈扩展到非欧几里得设置的首次尝试。当压缩关闭且选择特定范数时,EF21-Muon 恢复 Muon/Scion/Gluon,提供了该强大系列的首个高效分布式实现。我们的理论涵盖非欧几里得光滑情况以及更一般的 (L0,L1)(L^0, L^1)-光滑设置,匹配最佳的欧几里得速率,并在合适的范数选择下实现更快的收敛。我们进一步将分析扩展到层级(通用)光滑 regime,捕捉深度网络的各向异性结构。在 NanoGPT 基准测试中,对 EF21-Muon 与未压缩的 Muon/Scion/Gluon 进行评估,显示在不损失精度的前提下可实现最高 7×7\times 的通信节省。

关键词

引用

@article{arxiv.2510.00643,
  title  = {Error Feedback for Muon and Friends},
  author = {Kaja Gruntkowska and Alexander Gaponov and Zhirayr Tovmasyan and Peter Richtárik},
  journal= {arXiv preprint arXiv:2510.00643},
  year   = {2025}
}