分布式深度神经网络的性能建模
分布式、并行与集群计算
2016-12-16 v2
摘要
在过去的十年中,机器学习变得极为流行,并出现在我们日常生活的许多方面。如今,随着数据爆炸和计算能力的快速增长,分布式深度神经网络(DDNNs)能够通过更多计算资源线性提升性能,已成为热门趋势。然而,尚未对这些系统的性能及其扩展能力进行深入研究。在本文中,我们通过首先建立性能模型,然后在两种设置下评估系统来分析 CNTK(最常用的 DDNNs 之一):一个小型集群,所有节点在单个机架中连接到机架顶部交换机;以及使用 Blue Waters 的大规模任意节点放置。我们的主要焦点是系统相对于增加更多节点的可扩展性。基于我们的结果,由于 I/O 利用率低下,该系统具有过度的初始化开销,这主导了整个执行时间。因此,该系统无法扩展到超过几个节点(在 Blue Waters 中为 4 个)。此外,由于单服务器-多工作节点设计,服务器在 16 个节点后成为瓶颈,限制了 CNTK 的可扩展性。
引用
@article{arxiv.1612.00521,
title = {Performance Modeling of Distributed Deep Neural Networks},
author = {Sayed Hadi Hashemi and Shadi A. Noghabi and William Gropp and Roy H Campbell},
journal= {arXiv preprint arXiv:1612.00521},
year = {2016}
}