中文

RAMP:面向分布式深度学习系统的扁平化纳秒级光网络与MPI操作

分布式、并行与集群计算 2023-02-27 v2 机器学习 网络与互联网体系结构 系统与控制 系统与控制

摘要

分布式深度学习(DDL)系统高度依赖网络性能。当前的电子分组交换(EPS)网络架构和技术存在拓扑直径可变、对分带宽低和超额订阅等问题,影响通信和集合操作的完成时间。我们提出了一种名为RAMP的近亿亿级、全对分带宽、全对全、单跳、全光网络架构,具有纳秒级重构能力,可支持大规模分布式并行计算系统(每个节点12.8 Tbps,最多支持65,536个节点)。首次提出了一种定制的RAMP-x MPI策略和网络转码器,以无调度、无竞争的方式在光路交换(OCS)网络上运行MPI集合操作。与现实的EPS和OCS对应方案相比,RAMP在所有MPI操作上的完成时间实现了7.6至171倍的加速。它还能将Megatron和DLRM的训练时间分别减少1.3至16倍和7.8至58倍,同时在能耗和成本上分别实现42至53倍和3.3至12.4倍的改善。

关键词

引用

@article{arxiv.2211.15226,
  title  = {RAMP: A Flat Nanosecond Optical Network and MPI Operations for Distributed Deep Learning Systems},
  author = {Alessandro Ottino and Joshua Benjamin and Georgios Zervas},
  journal= {arXiv preprint arXiv:2211.15226},
  year   = {2023}
}