中文

面向均匀 GPU 上的容错且鲁棒的深度学习训练

分布式、并行与集群计算 2025-12-11 v1

摘要

尽管基于均匀 GPU 的深度学习训练已相当流行,但由于相关研究有限, straggler(拖延者)的存在情况、原因及其影响仍不为人所了解,现有缓解措施的有效性也亟待评估。为填补这一空白,我们进行了全面实验,发现 straggler 仍然普遍存在,主要源于 CPU 使用和带宽资源的不均衡。此外,现有缓解方法通过从同步随机梯度下降(SSGD)切换到异步 SGD(ASGD) 可能无法改善 Time-To-Accuracy(TTA),甚至会因更高的资源消耗而产生更多 straggler。为解决这些问题,我们提出了 Straggler Tolerant And Resilient DL training 系统 (STAR)。STAR 引入新的同步模式,对每个参数更新将工作者进行分组。它采用启发式方法和机器学习方法选择最优同步模式,以最小化 TTA,并在尽量减少协同作业影响的前提下重新分配资源以支持所选模式。此外,STAR 主动防止 straggler,通过避免在分配大量消耗 CPU 和带宽的 PS 以及梯度传输时对这些资源进行过载,从而实现预防。我们在 AWS 上的 trace-driven 评估表明,STAR 在 PS 架构下比当前最先进系统降低 48-84% TTA,在 all-reduce 架构下降低 51-70% TTA,同时保持 SSGD 的收敛精度。STAR 的代码已开源。

关键词

引用

@article{arxiv.2512.09685,
  title  = {Straggler Tolerant and Resilient DL Training on Homogeneous GPUs},
  author = {Zeyu Zhang and Haiying Shen},
  journal= {arXiv preprint arXiv:2512.09685},
  year   = {2025}
}