Muon 等方法的误差反馈
机器学习
2025-10-02 v1 最优化与控制
机器学习
摘要
最近的优化器如 Muon、Scion 和 Gluon 通过利用对非欧几里得范数球的层级线性最小化oracle (LMO) 推动了大规模深度学习的前沿,捕捉了神经网络结构,这是传统算法所不能够做到的。然而,这些方法尚不存在原则性的分布式框架,通信瓶颈仍未得到解决。少数几种分布式变体是经验性的,毫无收敛保证。我们引入了 EF21-Muon,这是第一个具有严格收敛保证的、通信高效的、非欧几里得 LMO 基于优化器。EF21-Muon 支持随机梯度、动量和双向压缩,以及误差反馈标记——这是对误差反馈扩展到非欧几里得设置的首次尝试。当压缩关闭且选择特定范数时,EF21-Muon 恢复 Muon/Scion/Gluon,提供了该强大系列的首个高效分布式实现。我们的理论涵盖非欧几里得光滑情况以及更一般的 -光滑设置,匹配最佳的欧几里得速率,并在合适的范数选择下实现更快的收敛。我们进一步将分析扩展到层级(通用)光滑 regime,捕捉深度网络的各向异性结构。在 NanoGPT 基准测试中,对 EF21-Muon 与未压缩的 Muon/Scion/Gluon 进行评估,显示在不损失精度的前提下可实现最高 的通信节省。
关键词
引用
@article{arxiv.2510.00643,
title = {Error Feedback for Muon and Friends},
author = {Kaja Gruntkowska and Alexander Gaponov and Zhirayr Tovmasyan and Peter Richtárik},
journal= {arXiv preprint arXiv:2510.00643},
year = {2025}
}