中文

基于 DMA 的更细粒度计算通信重叠设计空间探索

分布式、并行与集群计算 2025-12-12 v1 硬件体系结构 机器学习

摘要

随着 ML 训练和推理日益分布式,诸多分片技术被用于在分布式系统的 GPU 之间对 ML 模型进行划分部署。此类技术常导致数据依赖的通信和计算操作频繁出现,通信暴露在外,最高可损失高达 1.7 倍的理想性能。先前工作利用 ML 模型状态和输入已分片的事实,采用谨慎的单个计算/通信分片重叠技术。虽然粗粒度重叠具有前景,但本文主张更细粒度的计算-通信重叠 (FiCCO),即在分片级别之上更深层次的细粒度重叠,以打开更广泛的网络�拓扑、更细粒度数据流和更广泛应用场景的计算/通信重叠可能性。我们表明,FiCCO 打开了比仅凭分片级别可实现的执行调度表更大的设计空间。与此同时,将 ML 操作分解为更小的操作(如分片技术和更细粒度技术所做的那样)会导致操作层面的效率损失。为平衡这两者,我们首先呈现这些效率损失的详细特征,然后提出 FiCCO 调度的设计空间,最后将调度与相应的效率特征叠加。通过这种方式,我们设计出可供框架和运行时使用的启发式方法,以根据底层 ML 操作的特性选择定制的 FiCCO 调度。最后,通过将通信卸载到 GPU DMA 引擎,以进一步最小化操作重叠固有的争用效率损失。我们评估了来自真实 ML 部署的多个场景,证明所提出的定制调度可实现最高 1.6 倍加速,所提供的启发式方法在 81% 的未见场景中提供准确指导。

关键词

引用

@article{arxiv.2512.10236,
  title  = {Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap},
  author = {Shagnik Pal and Shaizeen Aga and Suchita Pati and Mahzabeen Islam and Lizy K. John},
  journal= {arXiv preprint arXiv:2512.10236},
  year   = {2025}
}