中文

考虑通信争用的多深度学习训练作业调度

分布式、并行与集群计算 2020-02-25 v1 计算机视觉与模式识别 机器学习

摘要

分布式深度学习(DDL)因其有助于在高性能 GPU 集群上提升训练性能而迅速普及。在同时训练多个作业时,高效的作业调度对于最大化集群整体性能不可或缺。然而,现有调度器未考虑来自不同分布式训练作业的多个通信任务之间的通信争用,这可能使系统性能恶化并延长作业完成时间。本文首先建立了一个新的 DDL 作业调度框架,该框架将 DDL 作业组织为有向无环图(DAG)并考虑节点间的通信争用。然后,我们提出一种高效算法 LWF-κ\kappa,以平衡 GPU 利用率并整合每个作业所分配的 GPU。在调度这些通信任务时,我们观察到,无论是避免所有争用还是盲目接受争用,都不是最小化作业完成时间的最优策略。因此我们提出一种可证明的算法 AdaDUAL,以高效调度这些通信任务。基于 AdaDUAL,我们最终针对 DDL 作业调度问题提出 Ada-SRSF。在由 10 Gbps 以太网连接的 64-GPU 集群上的仿真表明,LWF-κ\kappa 相较经典首次适应(first-fit)算法实现了高达 1.59×1.59\times 的提升。更重要的是,与 SRSF(1) 方案(避免所有争用)和 SRSF(2) 方案(盲目接受所有双向通信争用)相比,Ada-SRSF 分别将平均作业完成时间减少了 20.1%20.1\%36.7%36.7\%

关键词

引用

@article{arxiv.2002.10105,
  title  = {Communication Contention Aware Scheduling of Multiple Deep Learning Training Jobs},
  author = {Qiang Wang and Shaohuai Shi and Canhui Wang and Xiaowen Chu},
  journal= {arXiv preprint arXiv:2002.10105},
  year   = {2020}
}