Themis:一种面向深度学习模型分布式训练的网络带宽感知集合调度策略
分布式、并行与集群计算
2022-07-08 v3 硬件体系结构
机器学习
网络与互联网体系结构
摘要
分布式训练是一种通过将任务拆分到多个NPU(如GPU/TPU)上来减少DNN训练时间的解决方案。然而,根据并行化策略的不同,分布式训练为同步梯度及/或激活而在NPU之间增加了通信开销。在用于大规模训练的下一代平台中,NPU将通过具有多样化、异构带宽的多维网络相连。本工作指出,若沿用当今系统上针对集合通信的调度技术,在混合环境中保持所有网络维度繁忙并最大化网络带宽(BW)将面临迫在眉睫的挑战。我们提出Themis,一种新颖的集合调度方案,它动态调度集合通信(划分为块)以平衡所有维度上的通信负载,进一步提高网络BW利用率。我们的结果表明,平均而言,Themis可将单次All-Reduce的网络BW利用率提升1.72倍(最高2.70倍),并将ResNet-152、GNMT、DLRM和Transformer-1T等真实工作负载的端到端训练迭代性能分别提升1.49倍(最高2.25倍)、1.30倍(最高1.78倍)、1.30倍(最高1.77倍)和1.25倍(最高1.53倍)。
引用
@article{arxiv.2110.04478,
title = {Themis: A Network Bandwidth-Aware Collective Scheduling Policy for Distributed Training of DL Models},
author = {Saeed Rashidi and William Won and Sudarshan Srinivasan and Srinivas Sridharan and Tushar Krishna},
journal= {arXiv preprint arXiv:2110.04478},
year = {2022}
}