中文

InfiniteHBD:利用光电路交换收发器为大语言模型构建数据中心规模的高带宽域

网络与互联网体系结构 2025-08-05 v6 分布式、并行与集群计算 机器学习

摘要

扩展大语言模型 (LLM) 训练依赖于多维并行,其中高带宽域 (HBD) 对于张量并行等通信密集型并行至关重要。然而,现有的 HBD 架构在可扩展性、成本和故障弹性方面面临根本性限制:以交换机为中心的 HBD(例如 NVL-72)导致高昂的扩展成本,而以 GPU 为中心的 HBD(例如 TPUv3/Dojo)则遭受严重的故障传播。交换机-GPU 混合 HBD(例如 TPUv4)采取了一种折衷方案,但故障爆炸半径仍然很大。我们提出了 InfiniteHBD,一种以收发器为中心的 HBD 架构,通过在每个收发器内嵌入光电路交换 (OCS),在收发器层面集成连接性和动态交换。它支持可重构的点到多点通信和可扩展的可变大小环形拓扑。InfiniteHBD 实现了数据中心规模的可扩展性,且无成本爆炸,故障隔离在节点级别,并为健康 GPU 提供全带宽利用。关键创新包括基于硅光子学的 OCS 收发器 (OCSTrx)、可重构的 k 跳环形拓扑以及 HBD-DCN 编排算法。评估表明,InfiniteHBD 将成本降低至 NVL-72 的 31%,实现了接近零的 GPU 浪费率(比 NVL-72 和 TPUv4 低 10 倍以上),在 7% 节点故障率下保持接近零的跨 ToR 流量,并且与 NVIDIA DGX(每节点 8 个 GPU)相比,模型 FLOPs 利用率提高了 3.37 倍。

关键词

引用

@article{arxiv.2502.03885,
  title  = {InfiniteHBD: Building Datacenter-Scale High-Bandwidth Domain for LLM with Optical Circuit Switching Transceivers},
  author = {Chenchen Shou and Guyue Liu and Hao Nie and Huaiyu Meng and Yu Zhou and Yimin Jiang and Wenqing Lv and Yelong Xu and Yuanwei Lu and Zhang Chen and Yanbo Yu and Yichen Shen and Yibo Zhu and Daxin Jiang},
  journal= {arXiv preprint arXiv:2502.03885},
  year   = {2025}
}