EmbRace:加速 NLP 神经网络分布式训练的稀疏通信
机器学习
2022-06-28 v2 多智能体系统
摘要
分布式数据并行训练已被广泛应用于深度神经网络(DNN)模型。尽管当前的深度学习(DL)框架对于图像分类模型等稠密模型具有良好的可扩展性,但我们发现这些 DL 框架对于具有高度稀疏嵌入表的稀疏模型(如自然语言处理(NLP)模型)的可扩展性相对较低。现有的大多数工作忽略了模型参数的稀疏性,因此承受着显著且不必要的通信开销。在本文中,我们提出了 EmbRace,一个高效的通信框架,以加速稀疏模型的分布式训练通信。EmbRace 引入了稀疏感知混合通信,将 AlltoAll 和模型并行集成到数据并行训练中,从而降低高度稀疏参数的通信开销。为了有效地将稀疏通信与反向和前向计算重叠,EmbRace 进一步设计了一种 2D 通信调度方法,该方法优化了模型计算过程,放松了嵌入的依赖关系,并使用优先队列调度每个嵌入行的稀疏通信。我们基于 PyTorch 和 Horovod 实现了 EmbRace 的原型,并使用四个具有代表性的 NLP 模型进行了全面评估。实验结果表明,与最先进的分布式训练基线相比,EmbRace 实现了高达 2.41 倍的加速。
引用
@article{arxiv.2110.09132,
title = {EmbRace: Accelerating Sparse Communication for Distributed Training of NLP Neural Networks},
author = {Shengwei Li and Zhiquan Lai and Dongsheng Li and Yiming Zhang and Xiangyu Ye and Yabo Duan},
journal= {arXiv preprint arXiv:2110.09132},
year = {2022}
}