SHIFT:探索 RDMA 网络容错边界
网络与互联网体系结构
2026-02-27 v2
摘要
在大规模分布式大型语言模型 (LLM) 训练的 gang 调度下,单个网络异常可导致整个作业停滞或中止。当前的网络容错机制通常采用“回退和旁路”方法,分别在交换机 fabric 与接入层容错 in-network 与接入层故障。我们探讨了 RDMA 容错能否扩展至 cross-NIC 层级,通过将流量故障切换到宿主内部备用 NIC 实现。首次,我们证明了一个根本性的 Trilemma:在 Cross-NIC RDMA 故障切换中,同时实现 Exactly-Once Execution、Receiver-NIC Opacity 与 Zero-Copy 数据通路是不可能的。幸运的是,我们注意到主导训练框架 (如 NCCL) 依赖于幂等 bulk 传输,这只要保持 notification 排序即可容忍放宽的内存排序。利用这一洞见,我们提出 SHIFT,一个用户空间 RDMA 层,提供 cross-NIC 容错,同时保持正确的内存语义。我们在 \texttt{rdma-core} 中实现 SHIFT,并使用 PyTorch 分布式训练进行评估。结果表明,SHIFT 在正常运行期间开销可忽略,成功掩盖致命 NIC 故障和链路异常,使训练能够在不进行昂贵重启的情况下继续运行。
引用
@article{arxiv.2512.11094,
title = {SHIFT: Exploring the Boundary of RDMA Network Fault Tolerance},
author = {Shengkai Lin and Kairui Zhou and Hongtao Zhang and Yibo Wu and Yi Pan and Yihan Yang and Qinwei Yang and Wei Zhang and Arvind Krishnamurthy and Shizhen Zhao},
journal= {arXiv preprint arXiv:2512.11094},
year = {2026}
}