中文

节点内通信对超级计算机与数据中心互连网络性能的影响

硬件体系结构 2025-10-23 v2

摘要

在过去十年中,特定用途的计算和存储设备(如 GPU、TPU 或高速存储)已被集成到超级计算机和数据中心的服务器节点中。高带宽内存 (HBM) 的发展使这些设备的体积更加紧凑,从而允许在一个服务器节点内互连多个此类设备,通常使用节点内互连网络(如 PCIe、NVLink 或 Infinity Fabric)。这些网络允许扩展每个节点的特定计算和存储设备数量。此外,节点间网络负责连接超级计算机或数据中心中放置在不同服务器节点内的数千个此类设备。不幸的是,由于生成式 AI 等应用中加速器之间通信需求的不断增加,节点内和节点间网络可能成为系统瓶颈。尽管当前的节点内网络设计通过增加节点内网络带宽来缓解这一瓶颈,但我们在本文中表明,当来自节点外部的流量到达节点内设备时,如此高的节点内通信带宽可能会阻碍节点间通信性能,从而对节点内流量造成干扰。为了分析这种干扰的影响,我们研究了利用节点内通信的现实流量模式的通信操作。我们开发了一个基于 OMNeT++ 的通用节点内与节点间仿真模型,并对上述通信操作进行了建模。我们还进行了广泛的仿真实验,证实了增加节点内网络带宽和每个节点的计算设备(即加速器)数量对节点间通信性能适得其反。

关键词

引用

@article{arxiv.2502.20965,
  title  = {On the Impact of Intra-node Communication in the Performance of Supercomputer and Data Center Interconnection Networks},
  author = {Joaquin Tarraga-Moreno and Jesus Escudero-Sahuquillo and Pedro Javier Garcia and Francisco J. Quiles},
  journal= {arXiv preprint arXiv:2502.20965},
  year   = {2025}
}