中文

面向直连拓扑的高效全交换集合通信调度

分布式、并行与集群计算 2024-04-29 v2 网络与互联网体系结构

摘要

全交换(all-to-all)集合通信原语在机器学习(ML)和高性能计算(HPC)工作负载中被广泛使用,优化其性能对 ML 和 HPC 社区都具有重要意义。全交换是一种尤其具有挑战性的工作负载,在大规模下会严重挤占底层互连带宽。本文采取整体方法来优化超级计算机规模直连互连上的全交换集合通信性能。我们解决了为任意拓扑开发高效且带宽最优的全交换调度并将这些调度下放到各种运行时与互连技术时所面临的若干算法与实际挑战。我们还提出了一种可提供近最优全交换性能的新型拓扑。

关键词

引用

@article{arxiv.2309.13541,
  title  = {Efficient All-to-All Collective Communication Schedules for Direct-Connect Topologies},
  author = {Prithwish Basu and Liangyu Zhao and Jason Fantl and Siddharth Pal and Arvind Krishnamurthy and Joud Khoury},
  journal= {arXiv preprint arXiv:2309.13541},
  year   = {2024}
}

备注

HPDC '24