STL-SGD:以分阶段通信周期加速局部SGD
机器学习
2020-12-16 v2 分布式、并行与集群计算
最优化与控制
机器学习
摘要
分布式并行随机梯度下降算法是大规模机器学习任务的主力。其中,局部随机梯度下降(Local SGD)因其低通信复杂度而受到显著关注。先前的研究证明,当客户端上的数据分布相同(IID)或不相同(Non-IID)时,具有固定或自适应通信周期的Local SGD的通信复杂度分别为 和 量级,其中 为客户端数量, 为迭代次数。本文为通过降低通信复杂度加速收敛,提出 \textit{ST}agewise \textit{L}ocal \textit{SGD} (STL-SGD),其随学习率下降逐步增大通信周期。我们证明STL-SGD可保持与mini-batch SGD相同的收敛速率和线性加速比。此外,作为增大通信周期的好处,当目标为强凸或满足Polyak-\L ojasiewicz条件时,STL-SGD在IID和Non-IID情形下的通信复杂度分别为 和 ,相较Local SGD取得显著改进。在凸与非凸问题上的实验均展示了STL-SGD的优越性能。
引用
@article{arxiv.2006.06377,
title = {STL-SGD: Speeding Up Local SGD with Stagewise Communication Period},
author = {Shuheng Shen and Yifei Cheng and Jingchang Liu and Linli Xu},
journal= {arXiv preprint arXiv:2006.06377},
year = {2020}
}
备注
Accepted by AAAI2021