中文

STL-SGD:以分阶段通信周期加速局部SGD

机器学习 2020-12-16 v2 分布式、并行与集群计算 最优化与控制 机器学习

摘要

分布式并行随机梯度下降算法是大规模机器学习任务的主力。其中,局部随机梯度下降(Local SGD)因其低通信复杂度而受到显著关注。先前的研究证明,当客户端上的数据分布相同(IID)或不相同(Non-IID)时,具有固定或自适应通信周期的Local SGD的通信复杂度分别为 O(N32T12)O (N^{\frac{3}{2}} T^{\frac{1}{2}})O(N34T34)O (N^{\frac{3}{4}} T^{\frac{3}{4}}) 量级,其中 NN 为客户端数量,TT 为迭代次数。本文为通过降低通信复杂度加速收敛,提出 \textit{ST}agewise \textit{L}ocal \textit{SGD} (STL-SGD),其随学习率下降逐步增大通信周期。我们证明STL-SGD可保持与mini-batch SGD相同的收敛速率和线性加速比。此外,作为增大通信周期的好处,当目标为强凸或满足Polyak-\L ojasiewicz条件时,STL-SGD在IID和Non-IID情形下的通信复杂度分别为 O(NlogT)O (N \log{T})O(N12T12)O (N^{\frac{1}{2}} T^{\frac{1}{2}}),相较Local SGD取得显著改进。在凸与非凸问题上的实验均展示了STL-SGD的优越性能。

关键词

引用

@article{arxiv.2006.06377,
  title  = {STL-SGD: Speeding Up Local SGD with Stagewise Communication Period},
  author = {Shuheng Shen and Yifei Cheng and Jingchang Liu and Linli Xu},
  journal= {arXiv preprint arXiv:2006.06377},
  year   = {2020}
}

备注

Accepted by AAAI2021