光互连系统中用于分布式 DNN 训练的高效 All-reduce 算法
分布式、并行与集群计算
2023-02-20 v2 人工智能
新兴技术
摘要
通信效率在加速深度神经网络(DNN)的分布式训练中起着重要作用。All-reduce 是分布式 DNN 训练中归约模型参数的关键通信原语。大多数现有的 all-reduce 算法是为传统电互连系统设计的,由于电互连系统数据带宽低,无法满足大规模 DNN 分布式训练的通信需求。电互连的一个有前景的替代方案是光互连,其可提供高带宽、低传输延迟和低功耗。我们提出了一种称为 WRHT(波长复用层次树)的高效方案,用于在光互连系统中实现 all-reduce 操作。WRHT 可利用 WDM(波分复用)来减少分布式数据并行 DNN 训练的通信时间。我们进一步推导了光互连上 all-reduce 操作所需的波长数、最小通信步数以及通信时间。插入损耗的约束也在我们的分析中予以考虑。仿真结果表明,根据我们在光互连系统中的仿真,WRHT 的 all-reduce 通信时间相比三种传统 all-reduce 算法分别减少了 、 和 。我们的结果还表明,与在电互连系统中运行的两种现有 all-reduce 算法相比,WRHT 可将 all-reduce 操作的通信时间减少 和 。
关键词
引用
@article{arxiv.2207.10982,
title = {Efficient All-reduce for Distributed DNN Training in Optical Interconnect System},
author = {Fei Dai and Yawen Chen and Zhiyi Huang and Haibo Zhang and Fangfang Zhang},
journal= {arXiv preprint arXiv:2207.10982},
year = {2023}
}
备注
This paper is accepted by PPoPP as a poster