分布式与联邦优化中压缩梯度下降的加速
最优化与控制
2020-06-29 v2 分布式、并行与集群计算
机器学习
摘要
由于分布式与联邦学习问题中的高通信成本,依赖通信消息压缩的方法正日益流行。而在其他场景中,性能最佳的梯度类方法无不借助某种加速/动量形式以减少迭代次数,但目前尚无同时结合梯度压缩与加速二者优势的方法。本文弥补此不足,提出首个加速压缩梯度下降(ACGD)方法。在单机情形下,我们证明对于-强凸问题,ACGD的速率为;对于凸问题为,其中为压缩参数。我们的结果分别改进了现有的非加速速率与,并在无压缩()时作为特例恢复加速梯度下降的最优速率。我们进一步提出ACGD的分布式变体(称为ADIANA),并证明收敛速率,其中为设备/工作节点数,隐藏了对数因子。该结果改进了Mishchenko等人(2019)的DIANA方法所取得的先前最佳结果。最后,我们在真实数据集上进行了若干实验,佐证了理论结果并确认了加速方法的实际优越性。
引用
@article{arxiv.2002.11364,
title = {Acceleration for Compressed Gradient Descent in Distributed and Federated Optimization},
author = {Zhize Li and Dmitry Kovalev and Xun Qian and Peter Richtárik},
journal= {arXiv preprint arXiv:2002.11364},
year = {2020}
}
备注
ICML 2020