中文

感知异构性的异步去中心化训练

分布式、并行与集群计算 2019-09-19 v1 机器学习 系统与控制 系统与控制

摘要

分布式深度学习训练在齐次环境中通常采用 All-Reduce 作为数据并行算法的同步机制,因其高性能而广受青睐。然而,其性能受限于所有 worker 中最慢的一个,在异构情况下显著变慢。AD-PSGD 是一种新近提出的同步方法,具有数值上快速收敛和容忍异构性的优点,但存在死锁问题且同步开销高。是否有可能两全其美——设计一种分布式训练方法,既在齐次环境中具备 All-Reduce 的高性能,又像 AD-PSGD 一样具有良好的异构容忍性?本文提出 Ripples,一种高性能的感知异构性的异步去中心化训练方法。我们通过密集的同步优化实现了上述目标,强调算法与系统实现之间的相互作用。为降低同步成本,我们提出一种新颖的通信原语 Partial All-Reduce,允许一大组 worker 快速同步。为减少同步冲突,我们在齐次环境中提出静态组调度,并采用简单技术(Group Buffer 和 Group Division)以轻微降低随机性来避免冲突。实验表明,在齐次环境中,Ripples 比最先进的 All-Reduce 实现快 1.1 倍,比 Parameter Server 快 5.1 倍,比 AD-PSGD 快 4.3 倍。在异构环境中,Ripples 相比 All-Reduce 有 2 倍加速,且相比 Parameter Server 基线仍有 3 倍加速。

关键词

引用

@article{arxiv.1909.08029,
  title  = {Heterogeneity-Aware Asynchronous Decentralized Training},
  author = {Qinyi Luo and Jiaao He and Youwei Zhuo and Xuehai Qian},
  journal= {arXiv preprint arXiv:1909.08029},
  year   = {2019}
}