基于 10 万块 GPU 的容错 HSDP 训练 LLM
分布式、并行与集群计算
2026-02-03 v1 人工智能
摘要
大规模训练系统通常采用同步训练方式,要求所有 GPU 同时保持健康。在我们在 10 万块 GPU 上的实践中,同步训练因频繁的故障和长时间的恢复过程而导致效率低下。为解决此问题,我们提出一种新型训练范式:容错混合共享数据并行 (Fault Tolerant Hybrid-Shared Data Parallelism, FT-HSDP)。FT-HSDP 将数据并行副本作为容错单元。发生故障时,仅将包含故障 GPU 或服务器的单个数据并行副本下线并重启,而其他副本继续训练。为实现大规模部署,FT-HSDP 融合了多项技术:1) 我们引入容错 All Reduce (Fault Tolerant All Reduce, FTAR) 协议,用于跨数据并行副本进行梯度交换。FTAR 依赖 CPU 驱动复杂的控制逻辑(如动态添加或移除参与者),并依赖 GPU 执行数据传输以获得最佳性能。2) 我们引入一种非阻塞的追赶协议,使恢复副本能够以最小的停机时间加入训练。与 O(10 万块 GPU 上的全同步训练相比,FT-HSDP 可将故障恢复导致的停机时间从 10 分钟缩短至 3 分钟,将有效训练时间从 44% 提升至 80%。我们进一步证明,FT-HSDP 的异步恢复并未对结果模型的准确率造成任何显著性退化。
关键词
引用
@article{arxiv.2602.00277,
title = {Training LLMs with Fault Tolerant HSDP on 100,000 GPUs},
author = {Omkar Salpekar and Rohan Varma and Kenny Yu and Vladimir Ivanov and Yang Wang and Ahmed Sharif and Min Si and Shawn Xu and Feng Tian and Shengbao Zheng and Tristan Rice and Ankush Garg and Shangfu Peng and Shreyas Siravara and Wenyin Fu and Rodrigo de Castro and Adithya Gangidi and Andrey Obraztsov and Sharan Narang and Sergey Edunov and Maxim Naumov and Chunqiang Tang and Mathew Oldham},
journal= {arXiv preprint arXiv:2602.00277},
year = {2026}
}