中文

提升大规模去中心化分布式训练的效率

机器学习 2020-02-05 v1 分布式、并行与集群计算 机器学习

摘要

去中心化并行SGD(D-PSGD)及其异步变体异步并行SGD(AD-PSGD)是一类分布式学习算法,已被证明在大规模深度学习任务中表现良好。(A)D-PSGD的一个缺陷是,当系统中学习器数量增加时,混合矩阵的光谱间隙减小,从而阻碍收敛。本文中,我们研究在最小化通信成本的同时通过改善光谱间隙来加速(A)D-PSGD训练的技术。我们在2000小时Switchboard语音识别任务和ImageNet计算机视觉任务上运行实验,证明了所提技术的有效性。在IBM P9超级计算机上,我们的系统使用64块V100 GPU能在2.28小时内训练出LSTM声学模型,在Hub5-2000 Switchboard(SWB)测试集上词错率(WER)为7.5%,在CallHome(CH)测试集上为13.3%;使用128块V100 GPU能在1.98小时内训练出,SWB上WER为7.7%,CH上为13.3%,这是迄今报道的最快训练时间。

关键词

引用

@article{arxiv.2002.01119,
  title  = {Improving Efficiency in Large-Scale Decentralized Distributed Training},
  author = {Wei Zhang and Xiaodong Cui and Abdullah Kayi and Mingrui Liu and Ulrich Finkler and Brian Kingsbury and George Saon and Youssef Mroueh and Alper Buyuktosunoglu and Payel Das and David Kung and Michael Picheny},
  journal= {arXiv preprint arXiv:2002.01119},
  year   = {2020}
}