CANITA:带通信压缩的分布式凸优化更快收敛速率
机器学习
2021-11-09 v2 分布式、并行与集群计算
数据结构与算法
最优化与控制
摘要
由于分布式与联邦学习中的高通信成本,依赖压缩通信的方法正日益流行。此外,理论与实践中表现最佳的梯度类方法无不依赖某种形式的加速/动量来减少通信次数(更快收敛),例如 Nesterov 加速梯度下降(Nesterov, 1983, 2004)与 Adam(Kingma and Ba, 2014)。为结合通信压缩与收敛加速的优势,我们提出一种基于 ANITA(Li, 2021)的压缩且加速的梯度方法用于分布式优化,称之为 CANITA。我们的 CANITA 实现了首个加速速率 ,该速率改进了 DIANA(Khaled et al., 2020)针对分布式一般凸问题的当前最优非加速速率 ,其中 为目标误差, 为目标的平滑参数, 为机器/设备数量, 为压缩参数(较大的 意味着可施加更多压缩,无压缩对应 )。我们的结果表明,只要设备数量 较大(在分布式/联邦学习中通常成立),或压缩 不是非常高,CANITA 即可实现更快收敛速率 ,即通信轮数为 (而先前工作为 )。因此,CANITA 兼具压缩(每轮压缩通信)与加速(远少通信轮数)之优势。
引用
@article{arxiv.2107.09461,
title = {CANITA: Faster Rates for Distributed Convex Optimization with Communication Compression},
author = {Zhize Li and Peter Richtárik},
journal= {arXiv preprint arXiv:2107.09461},
year = {2021}
}
备注
NeurIPS 2021