中文

大步长同步分布式SGD的通信权衡

机器学习 2019-04-26 v1 最优化与控制 机器学习

摘要

同步小批量SGD是大规模分布式机器学习的最先进方法。然而在实践中,其收敛受限于工作节点间缓慢的通信轮次。减少通信的一个自然方案是使用“本地SGD”模型,其中工作节点独立训练模型并每隔一段时间进行同步。该算法改善了计算-通信权衡,但其收敛性尚不被充分理解。我们提出了一种非渐近误差分析,使其能够与“一次性平均”(即独立工作节点间单轮通信)和“小批量平均”(即每步通信)进行比较。我们还给出了大步长(tα t^{-\alpha} α(1/2,1) \alpha\in (1/2 , 1 ) )下通信频率的自适应下界,并表明“本地SGD”将通信减少了O(TP3/2) O\Big(\frac{\sqrt{T}}{P^{3/2}}\Big) 倍,其中T T 为梯度总数,P P 为机器数。

关键词

引用

@article{arxiv.1904.11325,
  title  = {Communication trade-offs for synchronized distributed SGD with large step size},
  author = {Kumar Kshitij Patel and Aymeric Dieuleveut},
  journal= {arXiv preprint arXiv:1904.11325},
  year   = {2019}
}