中文

光互连系统中用于分布式 DNN 训练的高效 All-reduce 算法

分布式、并行与集群计算 2023-02-20 v2 人工智能 新兴技术

摘要

通信效率在加速深度神经网络(DNN)的分布式训练中起着重要作用。All-reduce 是分布式 DNN 训练中归约模型参数的关键通信原语。大多数现有的 all-reduce 算法是为传统电互连系统设计的,由于电互连系统数据带宽低,无法满足大规模 DNN 分布式训练的通信需求。电互连的一个有前景的替代方案是光互连,其可提供高带宽、低传输延迟和低功耗。我们提出了一种称为 WRHT(波长复用层次树)的高效方案,用于在光互连系统中实现 all-reduce 操作。WRHT 可利用 WDM(波分复用)来减少分布式数据并行 DNN 训练的通信时间。我们进一步推导了光互连上 all-reduce 操作所需的波长数、最小通信步数以及通信时间。插入损耗的约束也在我们的分析中予以考虑。仿真结果表明,根据我们在光互连系统中的仿真,WRHT 的 all-reduce 通信时间相比三种传统 all-reduce 算法分别减少了 80.81%80.81\%64.36%64.36\%82.12%82.12\%。我们的结果还表明,与在电互连系统中运行的两种现有 all-reduce 算法相比,WRHT 可将 all-reduce 操作的通信时间减少 92.42%92.42\%91.31%91.31\%

关键词

引用

@article{arxiv.2207.10982,
  title  = {Efficient All-reduce for Distributed DNN Training in Optical Interconnect System},
  author = {Fei Dai and Yawen Chen and Zhiyi Huang and Haibo Zhang and Fangfang Zhang},
  journal= {arXiv preprint arXiv:2207.10982},
  year   = {2023}
}

备注

This paper is accepted by PPoPP as a poster