中文

大规模GPU数据中心中深度学习工作负载的特征刻画与预测

分布式、并行与集群计算 2021-09-07 v2 机器学习

摘要

现代GPU数据中心对于研究界和工业界交付深度学习(DL)模型与服务至关重要。在运营数据中心时,资源调度与管理的优化可带来显著的财务收益。实现该目标需要深入理解作业特征与用户行为。我们针对DL作业与资源管理的特征展开一项综合研究。首先,我们对来自商汤科技的真实作业轨迹进行大规模分析。我们从集群、作业和用户的角度揭示了若干有趣结论,可助力集群系统设计。其次,我们引入一个基于历史数据管理资源的通用框架。作为案例研究,我们设计了:一种准最短服务优先调度服务,可将集群整体平均作业完成时间最多降低6.5倍;以及一种集群节能服务,将整体集群利用率最多提升13%。

关键词

引用

@article{arxiv.2109.01313,
  title  = {Characterization and Prediction of Deep Learning Workloads in Large-Scale GPU Datacenters},
  author = {Qinghao Hu and Peng Sun and Shengen Yan and Yonggang Wen and Tianwei Zhang},
  journal= {arXiv preprint arXiv:2109.01313},
  year   = {2021}
}

备注

This paper has been accepted by the International Conference for High Performance Computing, Networking, Storage, and Analysis (SC21), Nov 14-19, 2021, St. Louis, USA