中文

SparDL:基于高效稀疏通信的分布式深度学习训练

机器学习 2024-02-26 v2 分布式、并行与集群计算

摘要

Top-k稀疏化近来被广泛用于减少分布式深度学习中的通信量。然而,由于稀疏梯度累积(SGA)困境,top-k稀疏化的性能仍存在局限。近来,已有若干方法被提出以应对SGA困境。遗憾的是,即使最先进的方法也存在若干缺陷,例如依赖低效的通信算法并需要额外的传输步骤。受现有方法局限性的启发,我们提出了一种新颖的高效稀疏通信框架,称为SparDL。具体而言,SparDL使用基于高效Reduce-Scatter模型的Spar-Reduce-Scatter算法,在无额外通信操作的情况下处理SGA困境。此外,为进一步降低延迟开销并提升SparDL效率,我们提出了Spar-All-Gather算法。并且,我们提出全局残差收集算法以确保模型训练的快速收敛。最后,进行了大量实验以验证SparDL的优越性。

关键词

引用

@article{arxiv.2304.00737,
  title  = {SparDL: Distributed Deep Learning Training with Efficient Sparse Communication},
  author = {Minjun Zhao and Yichen Yin and Yuren Mao and Qing Liu and Lu Chen and Yunjun Gao},
  journal= {arXiv preprint arXiv:2304.00737},
  year   = {2024}
}