中文

面向分布式DNN训练的基于优先级的参数传播

分布式、并行与集群计算 2019-05-13 v1 机器学习

摘要

数据并行训练被广泛用于扩展分布式深度神经网络(DNN)训练。然而,其性能收益常常受限于通信密集的参数同步步骤。在本文中,我们利用DNN训练的领域特定知识,将参数同步与计算重叠,以改善训练性能。我们提出两个关键观察:(1)通信所需的最优数据表示粒度可能不同于底层DNN模型实现所使用的粒度;(2)不同参数可承受不同的同步延迟。基于这些观察,我们提出一种称为基于优先级的参数传播(P3)的新同步机制。P3以更细的粒度同步参数,并调度数据传输,使训练过程产生最小的通信延迟。我们表明,在具有实际网络带宽的集群上,P3可将ResNet-50、Sockeye和VGG-19的训练吞吐量分别提高多达25%、38%和66%。

关键词

引用

@article{arxiv.1905.03960,
  title  = {Priority-based Parameter Propagation for Distributed DNN Training},
  author = {Anand Jayarajan and Jinliang Wei and Garth Gibson and Alexandra Fedorova and Gennady Pekhimenko},
  journal= {arXiv preprint arXiv:1905.03960},
  year   = {2019}
}

备注

In proceedings of the 2nd SysML Conference 2019