大步长同步分布式SGD的通信权衡
机器学习
2019-04-26 v1 最优化与控制
机器学习
摘要
同步小批量SGD是大规模分布式机器学习的最先进方法。然而在实践中,其收敛受限于工作节点间缓慢的通信轮次。减少通信的一个自然方案是使用“本地SGD”模型,其中工作节点独立训练模型并每隔一段时间进行同步。该算法改善了计算-通信权衡,但其收敛性尚不被充分理解。我们提出了一种非渐近误差分析,使其能够与“一次性平均”(即独立工作节点间单轮通信)和“小批量平均”(即每步通信)进行比较。我们还给出了大步长(,)下通信频率的自适应下界,并表明“本地SGD”将通信减少了倍,其中为梯度总数,为机器数。
引用
@article{arxiv.1904.11325,
title = {Communication trade-offs for synchronized distributed SGD with large step size},
author = {Kumar Kshitij Patel and Aymeric Dieuleveut},
journal= {arXiv preprint arXiv:1904.11325},
year = {2019}
}