面向多GPU DNN训练的工作负载感知自动并行化
分布式、并行与集群计算
2019-02-08 v2
摘要
深度神经网络(DNNs)已成为多种人工智能应用的成功解决方案,但其非常大且深的模型在训练期间带来高计算需求。多GPU并行化是加速DNN训练中繁重计算的流行选择,但大多数最先进的多GPU深度学习框架不仅要求用户深入理解框架自身的实现,而且以直接方式应用并行化而未优化GPU利用率。本工作中,我们提出一种用于DNN训练的工作负载感知自动并行化框架(WAP),其中工作基于工作负载特征自动分配到多个GPU。我们使用TensorFlow及流行DNN基准(AlexNet和VGG-16)评估WAP,显示出与最先进框架相当的训练吞吐量,并证明WAP基于工作负载的计算需求自动优化GPU分配,从而提升能效。
引用
@article{arxiv.1811.01532,
title = {Workload-aware Automatic Parallelization for Multi-GPU DNN Training},
author = {Sungho Shin and Youngmin Jo and Jungwook Choi and Swagath Venkataramani and Vijayalakshmi Srinivasan and Wonyong Sung},
journal= {arXiv preprint arXiv:1811.01532},
year = {2019}
}
备注
This paper is accepted in ICASSP2019