中文

SlowMo:利用慢动量改进通信高效的分布式 SGD

机器学习 2020-02-21 v2 分布式、并行与集群计算 最优化与控制 机器学习

摘要

分布式优化对于在大型数据集上训练大型模型至关重要。已有多种方法被提出以降低分布式训练中的通信开销,例如在多次局部 SGD 步后才同步,以及去中心化方法(例如使用 gossip 算法)来解耦工人间的通信。尽管这些方法比基于 AllReduce 的方法(其在每次更新前使用阻塞通信)运行更快,但在相同更新次数后所得模型的精度可能较低。受 Chen & Huo (2016) 的 BMUF 方法启发,我们提出一种慢动量(SlowMo)框架,其中工人在基础优化算法的多次迭代后周期性同步并执行动量更新。在图像分类与机器翻译任务上的实验表明,即便将额外开销分摊到多次更新上使得 SlowMo 运行时间与基础优化器相当,SlowMo 相对于基础优化器在优化与泛化性能上始终带来提升。我们提供理论收敛保证,表明 SlowMo 收敛到光滑非凸损失的驻点。由于 BMUF 可通过 SlowMo 框架表达,我们的结果也对应于 BMUF 的首个理论收敛保证。

关键词

引用

@article{arxiv.1910.00643,
  title  = {SlowMo: Improving Communication-Efficient Distributed SGD with Slow Momentum},
  author = {Jianyu Wang and Vinayak Tantia and Nicolas Ballas and Michael Rabbat},
  journal= {arXiv preprint arXiv:1910.00643},
  year   = {2020}
}

备注

Accepted to ICLR 2020