中文

Parameter Box:面向高效分布式深度神经网络训练的高性能参数服务器

分布式、并行与集群计算 2020-01-22 v3

摘要

深度学习系统社区多数工作聚焦于更快推理,但得到训练模型需漫长实验。加速训练可让开发者更快迭代并得出更好模型。DNN 训练常被视为计算受限问题,最好在含多 GPU 的单个大计算节点上完成。随着 DNN 变大,训练需走向分布式。分布式深度神经网络(DDNN)训练构成云上重要工作负载。更大的 DNN 模型与更快的计算引擎将训练性能瓶颈从计算转向通信。我们的实验表明,由于带宽不足和参数服务器软件栈低效,现有 DNN 训练框架在典型云环境中无法扩展。我们提出 PBox,一种均衡、可扩展的集中式 PS 硬件,可均衡计算与通信资源;以及 PHub,一种高性能参数服务器(PS)软件设计,提供优化网络栈和精简梯度处理流水线,以使常见 PS 配置受益于 PBox 的利用。我们展示在典型云环境中,训练 ImageNet 时 PBox 相比最先进设计最高可实现 3.8 倍加速。我们讨论了将 PBox 与可编程交换机集成以在训练中进行网内聚合、利用数据中心网络拓扑降低带宽占用并局部化数据移动的未来方向。

关键词

引用

@article{arxiv.1801.09805,
  title  = {Parameter Box: High Performance Parameter Servers for Efficient Distributed Deep Neural Network Training},
  author = {Liang Luo and Jacob Nelson and Luis Ceze and Amar Phanishayee and Arvind Krishnamurthy},
  journal= {arXiv preprint arXiv:1801.09805},
  year   = {2020}
}