中文

GPU 上分布式深度学习框架的性能建模与评估

分布式、并行与集群计算 2018-08-21 v3

摘要

深度学习框架已广泛部署于 GPU 服务器上,用于学术界与工业界的深度学习应用。在训练深度神经网络(DNNs)时,存在许多标准过程或算法,如卷积与随机梯度下降(SGD),但即便在同一 GPU 硬件上运行相同深度模型,不同框架的运行性能也可能不同。本研究在单 GPU、多 GPU 及多节点环境下评估了四种前沿分布式深度学习框架(即 Caffe-MPI、CNTK、MXNet 和 TensorFlow)的运行性能。我们首先建立采用 SGD 训练 DNNs 中标准过程的性能模型,随后以三种流行卷积神经网络(即 AlexNet、GoogleNet 和 ResNet-50)对这些框架的运行性能进行基准测试,进而分析导致这四者间性能差距的因素。通过分析与实验相结合,我们识别出可进一步优化的瓶颈与开销。主要贡献在于,所提性能模型与分析为算法设计与系统配置提供了进一步的优化方向。

关键词

引用

@article{arxiv.1711.05979,
  title  = {Performance Modeling and Evaluation of Distributed Deep Learning Frameworks on GPUs},
  author = {Shaohuai Shi and Qiang Wang and Xiaowen Chu},
  journal= {arXiv preprint arXiv:1711.05979},
  year   = {2018}
}

备注

Published at DataCom'2018