IntSGD:随机梯度的自适应无浮点压缩
机器学习
2022-03-22 v2 最优化与控制
机器学习
摘要
我们提出一类用于分布式随机梯度下降(SGD)的自适应整数压缩算子,其不通信任何单个浮点数。这是通过将浮点向量乘以每个设备已知的数值然后舍入为整数来实现的。与 Sapio 等人(2021)关于 SwitchML 的整数压缩先前工作相比,我们的 IntSGD 方法可证明收敛且计算更廉价,因为它自适应地估计向量的缩放。我们的理论表明,对于凸与非凸、光滑与非光滑函数,无论是否过参数化,IntSGD 的迭代复杂度在常数因子内与 SGD 匹配。此外,我们的算法也可针对流行的 all-reduce 原语定制,并展现出有前景的实证性能。
引用
@article{arxiv.2102.08374,
title = {IntSGD: Adaptive Floatless Compression of Stochastic Gradients},
author = {Konstantin Mishchenko and Bokun Wang and Dmitry Kovalev and Peter Richtárik},
journal= {arXiv preprint arXiv:2102.08374},
year = {2022}
}
备注
Spotlight at ICLR 2022. 27 pages, 6 figures, 3 algorithms