面向联邦学习的通信高效Gluon优化器
机器学习
2026-04-14 v1
摘要
最近的研究表明,基于线性最小化或判别(LMOs) over 非欧几里得范数球的Muon类优化器,在大型语言模型训练中可能优于Adam类方法。由于大规模神经网络跨越大量机器进行训练,通信成本成为瓶颈。为解决这一瓶颈,我们研究Gluon,这是一种在更一般的层级-光滑设置下的Muon扩展,包含无偏压缩器和收缩压缩器。为减少压缩误差,我们在压缩方法中采用SARAH中的方差归还技术。在 certain条件下,实现收敛率和改进的通信成本。作为副产品,我们获得了一种收敛速度快于Gluon的新型方差归还算法。我们还将动量方差归还(MVR)整合到这些压缩算法中,并在 时推导出较弱条件下的等效通信成本。最后,进行了若干数值实验,以验证在通信成本方面我们压缩算法的优越性能。
引用
@article{arxiv.2604.10689,
title = {Communication-Efficient Gluon in Federated Learning},
author = {Xun Qian and Alexander Gaponov and Grigory Malinovsky and Peter Richtárik},
journal= {arXiv preprint arXiv:2604.10689},
year = {2026}
}
备注
48 pages, 8 figures