中文

characterize 现代 HPC 互联网络中的拥塞影响

分布式、并行与集群计算 2026-04-14 v1

摘要

高性能计算 (HPC) 系统日益支持可扩展 AI 训练和大规模仿真工作负载。两者都严重依赖集体通信操作。然而,在现代超级计算机上,网络拥塞已成为主要限制因素,这是由于来自多样化工作负载混合的异构流量驱动的。随着系统规模和活跃用户数的持续增长,理解当代互联技术对拥塞的响应方式对于建立现实的性能预期并指导未来系统设计至关重要。本文对四大 HPC 架构的拥塞行为进行全面表征:EDR InfiniBand、HDR InfiniBand、NDR InfiniBand、Cray Slingshot 以及新兴的以太网架构。这些架构涵盖了高性能专有互联以及与 Ultra Ethernet 等新兴标准一致的自适应以太网设计。我们评估了它们对稳定拥塞以及广泛变化的 bursty 模式的响应,这些模式在持续时间、强度和暂停长度上各不相同,捕捉 AI 工作负载典型的 bursty 通信。我们的研究涵盖多个规模,检查拥塞如何随系统规模增大而表现不同,并识别影响集体性能的规模相关行为。通过分析在这些受控压力条件下所引发的挑战,我们旨在为拥塞问题及可能的优化提供实用概述。从本次评估中导出的见解可指导研究人员和 HPC 架构师设计更有效的拥塞控制机制和网络负载平衡策略。

关键词

引用

@article{arxiv.2604.11432,
  title  = {Characterizing the Impact of Congestion in Modern HPC Interconnects},
  author = {Lorenzo Piarulli and Marco Faltelli and Dirk Pleiter and Karthee Sivalingam and Dancheng Zhang and Kexue Zhao and Matteo Turisini and Francesco Iannone and Aldo Artigiani and Daniele De Sensi},
  journal= {arXiv preprint arXiv:2604.11432},
  year   = {2026}
}