面向多 GPU 系统的 LLM 张量并行计算感知式交换内计算
计算机视觉与模式识别
2026-05-08 v1 人工智能
机器学习
机器人学
摘要
大规模 LLM 的推理与训练中的张量并行(TP)引入频繁的集合通信操作,占据跨 GPU 通信的主导地位。虽然以 NVLink SHARP(NVLS)为代表的交换内计算通过减少数据传输加速了集合操作,但其通信中心化的设计理念导致其通信模式与 LLM 计算内核的内存语义要求之间存在不匹配。这种不匹配将计算和通信阶段隔离,导致资源利用率不足且在多 GPU 系统中重叠有限。为解决这一局限,我们提出了 CAIS,即首个面向计算感知的交换内计算框架,使通信模式与计算的内存语义要求相匹配。CAIS 由三项关键技术组成:(1)计算感知 ISA 和微体系结构扩展,以实现计算感知式交换内计算;(2)合并感知 TB(线程块)协调,以提高请求合并的时序对齐;(3)图层级数据流优化器,以实现紧密的跨内核重叠。在 LLM 工作负载评估中,CAIS 在平均情况下相较于基于 NVLS 的 SOTA 解决方案实现 1.38 倍的端到端加速,相较于不利用 NVLS 的 SOTA 计算-通信重叠方案 T3 实现 1.61 倍,充分展示了其在多 GPU 系统上加速 TP 的有效性。
引用
@article{arxiv.2605.05627,
title = {Leveraging Image Generators to Address Training Data Scarcity: The Gen4Regen Dataset for Forest Regeneration Mapping},
author = {Gabriel Jeanson and David-Alexandre Duclos and William Larrivée-Hardy and Noé Cochet and Matěj Boxan and Anthony Deschênes and François Pomerleau and Philippe Giguère},
journal= {arXiv preprint arXiv:2605.05627},
year = {2026}
}
备注
36 pages, 17 figures