中文

分布式与联邦优化中压缩梯度下降的加速

最优化与控制 2020-06-29 v2 分布式、并行与集群计算 机器学习

摘要

由于分布式与联邦学习问题中的高通信成本,依赖通信消息压缩的方法正日益流行。而在其他场景中,性能最佳的梯度类方法无不借助某种加速/动量形式以减少迭代次数,但目前尚无同时结合梯度压缩与加速二者优势的方法。本文弥补此不足,提出首个加速压缩梯度下降(ACGD)方法。在单机情形下,我们证明对于μ\mu-强凸问题,ACGD的速率为O((1+ω)Lμlog1ϵ)O\Big((1+\omega)\sqrt{\frac{L}{\mu}}\log \frac{1}{\epsilon}\Big);对于凸问题为O((1+ω)Lϵ)O\Big((1+\omega)\sqrt{\frac{L}{\epsilon}}\Big),其中ω\omega为压缩参数。我们的结果分别改进了现有的非加速速率O((1+ω)Lμlog1ϵ)O\Big((1+\omega)\frac{L}{\mu}\log \frac{1}{\epsilon}\Big)O((1+ω)Lϵ)O\Big((1+\omega)\frac{L}{\epsilon}\Big),并在无压缩(ω=0\omega=0)时作为特例恢复加速梯度下降的最优速率。我们进一步提出ACGD的分布式变体(称为ADIANA),并证明收敛速率O~(ω+Lμ+(ωn+ωn)ωLμ)\widetilde{O}\Big(\omega+\sqrt{\frac{L}{\mu}}+\sqrt{\big(\frac{\omega}{n}+\sqrt{\frac{\omega}{n}}\big)\frac{\omega L}{\mu}}\Big),其中nn为设备/工作节点数,O~\widetilde{O}隐藏了对数因子log1ϵ\log \frac{1}{\epsilon}。该结果改进了Mishchenko等人(2019)的DIANA方法所取得的先前最佳结果O~(ω+Lμ+ωLnμ)\widetilde{O}\Big(\omega + \frac{L}{\mu}+\frac{\omega L}{n\mu} \Big)。最后,我们在真实数据集上进行了若干实验,佐证了理论结果并确认了加速方法的实际优越性。

关键词

引用

@article{arxiv.2002.11364,
  title  = {Acceleration for Compressed Gradient Descent in Distributed and Federated Optimization},
  author = {Zhize Li and Dmitry Kovalev and Xun Qian and Peter Richtárik},
  journal= {arXiv preprint arXiv:2002.11364},
  year   = {2020}
}

备注

ICML 2020