SignMuon:面向分布式训练的通信高效 Muon 优化器
机器学习
2026-05-19 v1 分布式、并行与集群计算
摘要
大型神经网络的分布式训练受限于全精度梯度通信以及忽略权重张量矩阵结构的逐点优化器。我们提出 Sign-Muon,一种 1 位、面向矩阵结构的优化器,将 signSGD 中的多数投行为 sign 聚合,与 Muon 的极坐标步骤框架相结合。每个 worker 通过 Newton--Schulz 迭代对其动量的极坐标因子进行计算,仅传输条目级符号,并通过多数投票聚合;可选的本地极坐标步骤在不增加额外通信成本的前提下进一步强制正交性。在光谱范数光滑且随机梯度受界方差假设下,规范化的 sign 步骤可获得 非凸收敛率,针对 范数 stationarity 测度。当存在单峰对称噪声时,M 个 worker 上的多数投票可将随机项减小至 ,与 signSGD 一致。在 - 模型中,分布式 Sign-Muon 每迭代仅需一个整数 sum-allreduce;所有正交化均为本地计算,相较于 float32 降低 32 倍带宽(相较于 int8 降低 4 倍)。在 330 组 CIFAR-10/ResNet-50 配置中,Sign-Muon 获得最佳验证准确率(92.15%);其 4-GPU 多数投票变体在等效 batch 匹配时训练时间缩短 37%,达到 92.02%。在 nanoGPT 上,Sign-Muon 的每步 perplexity 更低, anytime 性能更好,其他基于 sign 的基线模型不行,且在最多 16 GPU 的情况下弱扩展性能良好。
引用
@article{arxiv.2605.16311,
title = {SignMuon: Communication-Efficient Distributed Muon Optimization},
author = {Neel Mishra and Kushagara Trivedi and Pawan Kumar},
journal= {arXiv preprint arXiv:2605.16311},
year = {2026}
}
备注
40 pages, 9 figures