RedSync:减少分布式深度学习的同步通信流量
分布式、并行与集群计算
2019-07-23 v3 计算机视觉与模式识别
机器学习
摘要
数据并行已成为跨多节点扩展深度神经网络(DNN)训练的主导方法。由于同步本地模型的大量梯度可能成为大规模分布式训练的瓶颈,压缩通信数据近期受到广泛关注。在若干近期提出的压缩算法中,残差梯度压缩(RGC)是最成功的方法之一——它可显著压缩每个节点的传输消息大小(梯度大小的0.1%),同时仍达到正确精度与相同收敛速度。然而,关于压缩深度网络的文献几乎 exclusively 聚焦于实现良好的理论压缩率,而RGC在实际分布式实现中的效率较少被研究。本文中,我们开发了一个基于RGC的系统,能够在真实多GPU系统上减少端到端训练时间。我们提出的设计称为RedSync,其引入一组优化以减少通信带宽需求,同时引入有限开销。我们在两种不同的多GPU平台上评估RedSync性能,包括超级计算机的128个GPU与一台8-GPU服务器。我们的测试用例包括Cifar10与ImageNet上的图像分类任务,以及Penn Treebank与Wiki2数据集上的语言建模任务。对于具有高通信计算比的DNN(长期被认为可扩展性差),RedSync带来了显著的性能提升。
引用
@article{arxiv.1808.04357,
title = {RedSync : Reducing Synchronization Traffic for Distributed Deep Learning},
author = {Jiarui Fang and Haohuan Fu and Guangwen Yang and Cho-Jui Hsieh},
journal= {arXiv preprint arXiv:1808.04357},
year = {2019}
}
备注
10 pages. Journal of Parallel and Distributed Computing, 2019