Stanza:面向深度学习分布式训练的层分离系统
机器学习
2019-01-11 v2 分布式、并行与集群计算
机器学习
摘要
参数服务器架构被普遍用于分布式深度学习。参数服务器系统中的每台工作机器都训练完整模型,这导致工作机器与服务器之间大量的网络数据传输。我们通过实验观察到,数据传输对训练时间有不可忽略的影响。为解决该问题,我们设计了一种称为Stanza的新分布式训练系统。Stanza利用如下事实:在许多模型(如卷积神经网络)中,大部分数据交换来自全连接层,而大部分计算在卷积层中完成。因此,我们提出分布式训练中的层分离:大多数节点仅训练卷积层,其余节点仅训练全连接层。全连接层的梯度和参数不再需要在集群间交换,从而大幅减少数据传输量。我们在PyTorch上实现Stanza,并在Azure和EC2上评估其性能。结果表明,Stanza相较当前参数服务器系统显著加速训练:例如在配备Tesla V100 GPU和10Gb带宽的EC2实例上,对常见深度学习模型Stanza快1.34倍至13.9倍。
引用
@article{arxiv.1812.10624,
title = {Stanza: Layer Separation for Distributed Training in Deep Learning},
author = {Xiaorui Wu and Hong Xu and Bo Li and Yongqiang Xiong},
journal= {arXiv preprint arXiv:1812.10624},
year = {2019}
}
备注
15 pages