中文

Parameter Hub:面向分布式深度神经网络训练的机架级参数服务器

分布式、并行与集群计算 2020-01-22 v2 机器学习 神经与进化计算

摘要

分布式深度神经网络(DDNN)训练是一种日益重要且常在云中运行的工作负载。更大的 DNN 模型和更快的计算引擎正将 DDNN 训练的瓶颈从计算转向通信。本文对 DDNN 训练进行表征以精确定位这些瓶颈。我们发现,及时训练需要具有高性参服务器(PS)且具备优化的网络栈和梯度处理流水线,以及计算和通信资源均衡的服务器与网络硬件。因此我们提出 PHub,一种高性能多租户、机架级 PS 设计。PHub 协同设计 PS 软件与硬件,以加速机架级和跨机架分层参数交换,其 API 与许多 DDNN 训练框架兼容。在基于云的 ImageNet 工作负载上,PHub 相比最先进的分布式训练技术提供高达 2.7 倍的性能提升,且每美元吞吐量提高 25%。

关键词

引用

@article{arxiv.1805.07891,
  title  = {Parameter Hub: a Rack-Scale Parameter Server for Distributed Deep Neural Network Training},
  author = {Liang Luo and Jacob Nelson and Luis Ceze and Amar Phanishayee and Arvind Krishnamurthy},
  journal= {arXiv preprint arXiv:1805.07891},
  year   = {2020}
}