中文

GPU 集群中分布式训练任务的隔离调度

分布式、并行与集群计算 2023-08-11 v1

摘要

分布式机器学习(DML)技术使得在合理时间内训练大型神经网络成为可能。同时,由于算力增长远快于网络容量,网络通信已逐渐成为 DML 的瓶颈。当前多租户 GPU 集群面临由哈希冲突问题引起的网络争用,这不仅进一步增加了通信开销,还造成了不公平性并影响用户体验。本文首先分析了在含 32 块 NVIDIA V100 GPU 的集群中网络争用如何影响训练时间。随后我们提出 vClos,通过联合优化分布式训练中的网络拓扑与通信模式来消除网络争用。还提出了一种在叶脊网络中引入一层光电路交换机(OCS)的 OCS-vClos,以减少 vClos 资源分配策略所引起的潜在网络资源碎片。通过测试床实验与基于真实轨迹的大规模仿真,证明了 vClos 相对于现有网络资源调度策略的优越性。

关键词

引用

@article{arxiv.2308.05692,
  title  = {Isolated Scheduling for Distributed Training Tasks in GPU Clusters},
  author = {Xinchi Han and Weihao Jiang and Peirui Cao and Qinwei Yang and Yunzhuo Liu and Shuyao Qi and Shengkai Lin and Shizhen Zhao},
  journal= {arXiv preprint arXiv:2308.05692},
  year   = {2023}
}