HammingMesh:一种面向大规模深度学习网络拓扑
分布式、并行与集群计算
2022-10-24 v2 人工智能
硬件体系结构
网络与互联网体系结构
性能
摘要
众多的微体系结构优化释放了深度神经网络巨大的处理能力,进而推动了 AI 革命。随着此类优化趋于枯竭,现代 AI 的增长如今受限于训练系统的性能,尤其是其数据移动。我们不再聚焦于单个加速器,而是以全系统尺度考察大规模训练的数据移动特征。基于工作负载分析,我们设计了 HammingMesh,一种以低成本提供高带宽且具备高作业调度灵活性的新型网络拓扑。具体而言,HammingMesh 可为具有二维并行性的深度学习训练作业提供全带宽与隔离。此外,它亦支持面向通用流量的高全局带宽。因此,HammingMesh 将以极致带宽需求驱动未来大规模深度学习系统。
引用
@article{arxiv.2209.01346,
title = {HammingMesh: A Network Topology for Large-Scale Deep Learning},
author = {Torsten Hoefler and Tommaso Bonato and Daniele De Sensi and Salvatore Di Girolamo and Shigang Li and Marco Heddes and Jon Belk and Deepak Goel and Miguel Castro and Steve Scott},
journal= {arXiv preprint arXiv:2209.01346},
year = {2022}
}
备注
published at ACM/IEEE Supercomputing (SC22)