中文

Parallax:面向深度神经网络稀疏感知的数据并行训练

分布式、并行与集群计算 2019-06-11 v3

摘要

使用高性能服务器和 GPU 加速器训练深度神经网络模型极大地加速了深度学习(DL)近期的进展。诸如 TensorFlow、MXNet 和 Caffe2 等 DL 框架已涌现,以协助 DL 研究者在分布式方式下训练其模型。尽管当前 DL 框架在图像分类模型上扩展性良好,但在自然语言处理(NLP)模型的可扩展分布式训练方面仍存在机会。我们发现,由于未考虑模型参数稀疏性的差异,当前框架在训练 NLP 模型时表现出相对较低的扩展性。本文中,我们提出 Parallax,一个通过利用模型参数的稀疏性来优化数据并行训练的框架。Parallax 引入了一种结合参数服务器(Parameter Server)与 AllReduce 架构的混合方法,以根据稀疏性优化数据传输量。实验表明,构建于 TensorFlow 之上的 Parallax 在稠密和稀疏模型上均实现了可扩展的训练吞吐量,且对用户所需投入极少。使用 48 块 GPU,Parallax 对 NLP 模型分别实现了比 TensorFlow 和 Horovod 最高 2.8 倍、6.02 倍的加速。图像分类模型的训练速度与 Horovod 持平,且比 TensorFlow 快 1.53 倍。

关键词

引用

@article{arxiv.1808.02621,
  title  = {Parallax: Sparsity-aware Data Parallel Training of Deep Neural Networks},
  author = {Soojeong Kim and Gyeong-In Yu and Hojin Park and Sungwoo Cho and Eunji Jeong and Hyeonmin Ha and Sanha Lee and Joo Seong Jeong and Byung-Gon Chun},
  journal= {arXiv preprint arXiv:1808.02621},
  year   = {2019}
}

备注

13 pages, 9 figures