中文

面向现代HPC系统的GPU发起通信与协调的高性能运行时——GICC

分布式、并行与集群计算 2026-04-27 v1

摘要

分布式GPU应用日益依赖于内核级、跨节点的协调以减少启动开销并提高计算-通信重叠,但此类支持仍不足。在基于OFI的互联网络(如HPE Slingshot)上,后者为2025年11月Top500榜单中的六大系统之一(包括前三名)提供动力,GPU内核无法自主驱动分布式协调:现有运行时依赖主机驱动进度,且缺乏对重复GPU触发操作中预置NIC工作资源的受限回收机制。在InfiniBand上,GPU发起通信是可能的,但现有实现产生不必要的同步和锁定开销。本文提出GICC框架,使GPU内核能够在不涉及主机的情况下直接触发NIC级操作。针对s stencil计算,GPU线程可在边界区域计算完成后立即发起halo交换,实现计算内部与边界传输的细粒度重叠。GICC将协调语义与数据传输解耦,引入异步资源回收:NIC向GPU和主机内存信号完成,使轻量级主机线程可在GPU执行期间同时回收NIC资源,而不在协调路径中引入延迟。这在NIC状态有限且现有OFI运行时缺乏GPU驱动协调的情形下持续实现GPU驱动的协调。我们在NVIDIA和AMD GPU上实现GICC,分别在InfiniBand和Slingshot上进行测试。在Slingshot上,GICC将协调延迟降低最高达229倍,并提升弱扩展效率最高达25%。在InfiniBand上,GICC比NVSHMEM实现的最高put延迟降低1.95倍,通过消除不必要的锁定和同步。对于64个AMD MI250X GCDs上的工业级stencil代理,GPU感知MPI的通信时间比GICC高出52%,GICC实现42%的并行效率,而MPI仅为35.4%。

关键词

引用

@article{arxiv.2604.22126,
  title  = {GICC: A High-Performance Runtime for GPU-Initiated Communication and Coordination in Modern HPC Systems},
  author = {Baodi Shan and Mauricio Araya-Polo and Barbara Chapman},
  journal= {arXiv preprint arXiv:2604.22126},
  year   = {2026}
}