中文

CANITA:带通信压缩的分布式凸优化更快收敛速率

机器学习 2021-11-09 v2 分布式、并行与集群计算 数据结构与算法 最优化与控制

摘要

由于分布式与联邦学习中的高通信成本,依赖压缩通信的方法正日益流行。此外,理论与实践中表现最佳的梯度类方法无不依赖某种形式的加速/动量来减少通信次数(更快收敛),例如 Nesterov 加速梯度下降(Nesterov, 1983, 2004)与 Adam(Kingma and Ba, 2014)。为结合通信压缩与收敛加速的优势,我们提出一种基于 ANITA(Li, 2021)的压缩且加速的梯度方法用于分布式优化,称之为 CANITA。我们的 CANITA 实现了首个加速速率 O((1+ω3n)Lϵ+ω(1ϵ)13)O\bigg(\sqrt{\Big(1+\sqrt{\frac{\omega^3}{n}}\Big)\frac{L}{\epsilon}} + \omega\big(\frac{1}{\epsilon}\big)^{\frac{1}{3}}\bigg),该速率改进了 DIANA(Khaled et al., 2020)针对分布式一般凸问题的当前最优非加速速率 O((1+ωn)Lϵ+ω2+ωω+n1ϵ)O\left((1+\frac{\omega}{n})\frac{L}{\epsilon} + \frac{\omega^2+\omega}{\omega+n}\frac{1}{\epsilon}\right),其中 ϵ\epsilon 为目标误差,LL 为目标的平滑参数,nn 为机器/设备数量,ω\omega 为压缩参数(较大的 ω\omega 意味着可施加更多压缩,无压缩对应 ω=0\omega=0)。我们的结果表明,只要设备数量 nn 较大(在分布式/联邦学习中通常成立),或压缩 ω\omega 不是非常高,CANITA 即可实现更快收敛速率 O(Lϵ)O\Big(\sqrt{\frac{L}{\epsilon}}\Big),即通信轮数为 O(Lϵ)O\Big(\sqrt{\frac{L}{\epsilon}}\Big)(而先前工作为 O(Lϵ)O\big(\frac{L}{\epsilon}\big))。因此,CANITA 兼具压缩(每轮压缩通信)与加速(远少通信轮数)之优势。

关键词

引用

@article{arxiv.2107.09461,
  title  = {CANITA: Faster Rates for Distributed Convex Optimization with Communication Compression},
  author = {Zhize Li and Peter Richtárik},
  journal= {arXiv preprint arXiv:2107.09461},
  year   = {2021}
}

备注

NeurIPS 2021