大规模GPU数据中心中深度学习工作负载的特征刻画与预测
分布式、并行与集群计算
2021-09-07 v2 机器学习
摘要
现代GPU数据中心对于研究界和工业界交付深度学习(DL)模型与服务至关重要。在运营数据中心时,资源调度与管理的优化可带来显著的财务收益。实现该目标需要深入理解作业特征与用户行为。我们针对DL作业与资源管理的特征展开一项综合研究。首先,我们对来自商汤科技的真实作业轨迹进行大规模分析。我们从集群、作业和用户的角度揭示了若干有趣结论,可助力集群系统设计。其次,我们引入一个基于历史数据管理资源的通用框架。作为案例研究,我们设计了:一种准最短服务优先调度服务,可将集群整体平均作业完成时间最多降低6.5倍;以及一种集群节能服务,将整体集群利用率最多提升13%。
引用
@article{arxiv.2109.01313,
title = {Characterization and Prediction of Deep Learning Workloads in Large-Scale GPU Datacenters},
author = {Qinghao Hu and Peng Sun and Shengen Yan and Yonggang Wen and Tianwei Zhang},
journal= {arXiv preprint arXiv:2109.01313},
year = {2021}
}
备注
This paper has been accepted by the International Conference for High Performance Computing, Networking, Storage, and Analysis (SC21), Nov 14-19, 2021, St. Louis, USA