面向云与HPC的扩展式深度学习训练
分布式、并行与集群计算
2018-01-25 v1 机器学习
摘要
大型深度神经网络使用量的指数级增长加速了对在数小时甚至数分钟内训练这些深度神经网络的需求。这只能通过可扩展且高效的分布式训练来实现,因为单个节点/卡无法满足当今最先进深度神经网络的计算、内存和I/O需求。然而,同步随机梯度下降(SGD)的扩展仍是一个具有挑战性的问题,需要持续的研究/开发。这需要在算法、框架、通信库和系统设计方面的创新。本文描述了Intel机器学习可扩展性库(MLSL)的理念、设计与实现,并给出了在云与HPC系统上数百至数千节点扩展DL训练的证明点。
引用
@article{arxiv.1801.08030,
title = {On Scale-out Deep Learning Training for Cloud and HPC},
author = {Srinivas Sridharan and Karthikeyan Vaidyanathan and Dhiraj Kalamkar and Dipankar Das and Mikhail E. Smorkalov and Mikhail Shiryaev and Dheevatsa Mudigere and Naveen Mellempudi and Sasikanth Avancha and Bharat Kaul and Pradeep Dubey},
journal= {arXiv preprint arXiv:1801.08030},
year = {2018}
}
备注
Accepted in SysML 2018 conference