中文

面向分布式 DNN 训练的域特定通信优化

分布式、并行与集群计算 2020-08-20 v1 机器学习

摘要

通信开销对分布式 DNN 训练构成了重要障碍,近年来受到越来越多的关注。尽管不断努力,先前的方案如梯度压缩/缩减、计算/通信重叠和逐层流调度等,仍显粗粒度,不足以实现高效的分布式训练,尤其在网络承压时。我们提出 DLCP,一种利用深度学习的域特定性质以细粒度方式优化 DNN 训练通信开销的新方案。其核心在于,DLCP 包含了超越先前工作的若干关键创新:例如,它利用基于 SGD 训练的 \emph{有界损失容忍度} 来改善尾部通信延迟,而纯梯度压缩无法避免该延迟。继而它执行细粒度的包级优先级与丢弃,而非流级调度,基于梯度层级与幅值进一步加速模型收敛而不影响精度。此外,它利用包间顺序无关性执行每包负载均衡而避免经典乱序问题。DLCP 同时兼容参数服务器与集合通信例程。我们已在商用交换机上实现 DLCP,将其集成至包括 TensorFlow、MXNet 和 PyTorch 的多种训练框架,并部署于含 10 块 Nvidia V100 GPU 的小规模测试床。测试床实验与大规模仿真表明,相较最佳现有方案,DLCP 带来高达 84.3%84.3\% 的额外训练加速。

关键词

引用

@article{arxiv.2008.08445,
  title  = {Domain-specific Communication Optimization for Distributed DNN Training},
  author = {Hao Wang and Jingrong Chen and Xinchen Wan and Han Tian and Jiacheng Xia and Gaoxiong Zeng and Weiyan Wang and Kai Chen and Wei Bai and Junchen Jiang},
  journal= {arXiv preprint arXiv:2008.08445},
  year   = {2020}
}