中文

RoCE 拥塞控制策略对 DNN 分布式训练的影响

网络与互联网体系结构 2022-07-25 v1 人工智能

摘要

RDMA over Converged Ethernet(RoCE)因与传统基于以太网的结构兼容,在数据中心网络中受到显著关注。然而,RDMA 协议仅在(近乎)无损网络上高效,这凸显了 RoCE 网络拥塞控制的关键作用。遗憾的是,基于优先级流控(PFC)的原生 RoCE 拥塞控制方案存在诸多缺陷,如不公平、队头阻塞与死锁。因此,近年来提出许多方案为 RoCE 网络提供额外拥塞控制以最小化 PFC 缺陷。但这些方案面向通用数据中心环境。与采用商用硬件运行通用负载的通用数据中心不同,高性能分布式训练平台部署高端加速器与网络组件,并专用于运行使用集合通信库(All-Reduce、All-To-All)进行通信的训练负载。此外,这些平台通常拥有私有网络,将其通信流量与数据中心其余流量隔离。可扩展的拓扑感知集合算法本身旨在避免 incast 模式并最优平衡流量。这些显著特征 necessitate 重新审视先前提出的面向通用数据中心的拥塞控制方案。本文深入分析了在分布式训练平台上运行时若干 SOTA RoCE 拥塞控制方案与 PFC 的对比。结果表明,先前提出的 RoCE 拥塞控制方案对训练负载端到端性能影响甚微,这促使有必要基于分布式训练平台与负载特征设计一种优化且低开销的拥塞控制方案。

关键词

引用

@article{arxiv.2207.10898,
  title  = {Impact of RoCE Congestion Control Policies on Distributed Training of DNNs},
  author = {Tarannum Khan and Saeed Rashidi and Srinivas Sridharan and Pallavi Shurpali and Aditya Akella and Tushar Krishna},
  journal= {arXiv preprint arXiv:2207.10898},
  year   = {2022}
}