从 ML 视角重新思考 RDMA
分布式、并行与集群计算
2025-10-30 v1 网络与互联网体系结构
摘要
随着分布式机器学习 (ML) 工作负载扩展到数千个 GPU 通过超高速互联互连,集合通信中的尾延迟已成为主要瓶颈。先前的 RDMA 设计(如 RoCE、IRN 和 SRNIC)强制执行严格的可靠性和有序递送,依赖重传和数据包排序以确保正确性。虽然对通用工作负载有效,但这些机制引入了复杂性和延迟,随规模不成比例地增加,其中即使是罕见的 packet loss 或延迟也会持续降低系统性能。我们引入 Celeris,这是一种面向 ML 的域特定 RDMA 传输,重新审视基于 ML 对丢失或部分数据容忍性的可靠性保证。Celeris 从 RDMA NIC 中移除重传和有序递送,实现最佳效应传输,利用 ML 工作负载的鲁棒性。它保留拥塞控制(如 DCQCN),并通过自适应超时和数据优先级等软件级机制来管理通信,同时将损失恢复移至 ML 管道(例如使用哈达巴变换)。早期结果表明,Celeris 将 99 百分位延迟降低最高 2.3 倍,将 BRAM 用量降低 67%,并将 NIC 对故障的韧性几乎翻倍——为 ML 规模集群提供韧性、可扩展的传输。
引用
@article{arxiv.2510.16606,
title = {Reimagining RDMA Through the Lens of ML},
author = {Ertza Warraich and Ali Imran and Annus Zulfiqar and Shay Vargaftik and Sonia Fahmy and Muhammad Shahbaz},
journal= {arXiv preprint arXiv:2510.16606},
year = {2025}
}
备注
4 pages