深度学习工作负载的有效弹性伸缩
分布式、并行与集群计算
2020-06-25 v1 机器学习
摘要
深度学习(DL)在学术界、政府和工业界的日益广泛使用,进而导致了本地与云托管深度学习平台的流行,其目标是使组织有效利用昂贵资源,并以公平有效的方式在多个团队间共享所述资源。在本文中,我们考察了大规模训练平台上深度学习(DL)作业的弹性伸缩,并提出了一种针对DL训练作业的新型资源分配策略,从而改善作业运行时间性能并提高集群利用率。我们首先分析DL工作负载,并利用DL作业可用一系列批大小运行而不影响其最终精度这一事实。我们形式化了一个优化问题,基于各DL作业在多个节点上运行时的伸缩效率,探索对其动态批大小分配。我们设计了一个基于快速动态规划的优化器实时求解该问题,以确定可放大/缩小的作业,并在自动伸缩器中用此优化器动态改变各DL作业的分配资源与批大小。我们实证表明,与同样伸缩GPU数量但不改变批大小的强基线算法相比,我们的弹性伸缩算法可完成的作业数最多达 。我们还表明,使用我们算法的平均完成时间比基线快最多 。
引用
@article{arxiv.2006.13878,
title = {Effective Elastic Scaling of Deep Learning Workloads},
author = {Vaibhav Saxena and K. R. Jayaram and Saurav Basu and Yogish Sabharwal and Ashish Verma},
journal= {arXiv preprint arXiv:2006.13878},
year = {2020}
}