中文

洗牌-交换带来更快:减少去中心化神经网络训练通信中的空闲时间

分布式、并行与集群计算 2020-07-17 v2

摘要

作为加速深度神经网络(DNN)训练的关键方案,分布式随机梯度下降(DSGD)被广泛应用于许多实际场景。在大多数分布式深度学习(DL)框架中,DSGD 以 Ring-AllReduce 架构(Ring-SGD)实现,并采用计算-通信重叠策略来解决 DSGD 所需大量通信的开销。然而,我们观察到,尽管 Ring-SGD 中每个工作节点需通信 O(1)O(1) 梯度,但其所需的 O(n)O(n) 次握手限制了其在多工作节点或高延迟网络中的使用。本文提出 Shuffle-Exchange SGD(SESGD)以解决 Ring-SGD 的困境。在 16 个工作节点、0.1ms 以太网延迟的集群中,SESGD 可在不损失模型精度的情况下将 DNN 训练加速至 1.7×1.7 \times。此外,在高延迟网络(5ms)中该过程可加速至 5×5\times

关键词

引用

@article{arxiv.2007.00433,
  title  = {Shuffle-Exchange Brings Faster: Reduce the Idle Time During Communication for Decentralized Neural Network Training},
  author = {Xiang Yang},
  journal= {arXiv preprint arXiv:2007.00433},
  year   = {2020}
}

备注

NeurIPS 2020 Under Review