中文

SuperNeurons: 深度神经网络分布式训练中的基于 FFT 的梯度稀疏化

分布式、并行与集群计算 2021-02-10 v2

摘要

深度神经网络分布式训练的性能和效率高度依赖于所有参与节点间梯度平均的性能,而后者受限于节点间的通信。减少通信开销有两大主要策略:一是通过将通信与计算重叠来隐藏通信,二是减小消息大小。第一种方案对线性神经架构效果良好,但最新的网络如 ResNet 和 Inception 为此类重叠提供的机会有限。因此,研究者更多地关注于最小化通信。本文中,我们提出一种新颖的梯度压缩框架,其源于对真实梯度分布的洞察,并在压缩比、精度和计算开销之间取得平衡。我们的框架有两个主要新颖组件:在频域中对梯度进行稀疏化,以及一种基于范围浮点表示来量化并进一步压缩梯度频率的方法。两个组件都是动态的,具有可调参数,可根据精度要求和系统平台实现不同的压缩比,并在 GPU 上实现非常高的吞吐量。我们证明,我们的技术在压缩比递减的情况下保证收敛。我们的实验表明,所提出的压缩框架在 32 GPU 集群上有效提升了大多数流行神经网络相对于无压缩基线的可扩展性,且不损害精度和收敛速度。

关键词

引用

@article{arxiv.1811.08596,
  title  = {SuperNeurons: FFT-based Gradient Sparsification in the Distributed Training of Deep Neural Networks},
  author = {Linnan Wang and Wei Wu and Junyu Zhang and Hang Liu and George Bosilca and Maurice Herlihy and Rodrigo Fonseca},
  journal= {arXiv preprint arXiv:1811.08596},
  year   = {2021}
}

备注

10 pages