分布式学习中的无偏压缩与符号压缩:基于 SDE 的抗噪性能比较
机器学习
2025-03-03 v2
摘要
分布式方法对于处理包含大规模模型和数据集的机器学习流水线至关重要。然而,其优势往往以中央服务器与各代理之间增加的通信开销为代价,这可能成为主要瓶颈,使得此类系统中的训练成本高昂甚至不可行。量化与稀疏化等压缩方法可以缓解这一问题。然而,它们对大且重尾梯度噪声(在语言建模中有时会观察到的现象)的鲁棒性仍知之甚少。本文通过使用随机微分方程(SDEs)分析分布式压缩 SGD(DCSGD)和分布式符号 SGD(DSignSGD)来填补这一空白。我们的结果表明,采用无偏压缩的 DCSGD 对随机梯度中的噪声更为脆弱,而 DSignSGD 即使在大且重尾噪声下仍保持鲁棒。此外,我们提出了用于超参数调优的新缩放规则,以减轻由压缩导致的性能下降。这些发现在多种深度学习架构和数据集上得到了实验验证,为分布式优化提供了实用建议。
引用
@article{arxiv.2502.17009,
title = {Unbiased and Sign Compression in Distributed Learning: Comparing Noise Resilience via SDEs},
author = {Enea Monzio Compagnoni and Rustem Islamov and Frank Norbert Proske and Aurelien Lucchi},
journal= {arXiv preprint arXiv:2502.17009},
year = {2025}
}
备注
Accepted at AISTATS 2025 (Oral). arXiv admin note: substantial text overlap with arXiv:2411.15958