ParvaGPU: 面向云环境中大规模 DNN 推理的高效空间 GPU 共享
分布式、并行与集群计算
2024-09-24 v1
摘要
在云环境中,基于 GPU 的深度神经网络(DNN)推理服务器需要在指定的请求速率下满足每个工作负载的服务水平目标(SLO)延迟,同时最小化 GPU 资源消耗。然而,先前的研究尚未完全实现这一目标。在本文中,我们提出了 ParvaGPU,这是一种促进云计算中大规模 DNN 推理空间 GPU 共享的技术。ParvaGPU 集成了 NVIDIA 的多实例 GPU(MIG)和多进程服务(MPS)技术以提高 GPU 利用率,旨在满足每个工作负载的多样化 SLO 并减少整体 GPU 使用量。具体而言,ParvaGPU 解决了在分配的 GPU 空间分区内最小化利用不足以及在 MIG 与 MPS 结合环境中的外部碎片化挑战。我们在多块 A100 GPU 上进行了评估,针对具有不同 SLO 的 11 种多样化 DNN 工作负载进行了评测。我们的评估表明,与最先进的框架相比,未发生 SLO 违规,且 GPU 使用量显著减少。
引用
@article{arxiv.2409.14447,
title = {ParvaGPU: Efficient Spatial GPU Sharing for Large-Scale DNN Inference in Cloud Environments},
author = {Munkyu Lee and Sihoon Seong and Minki Kang and Jihyuk Lee and Gap-Joo Na and In-Geol Chun and Dimitrios Nikolopoulos and Cheol-Ho Hong},
journal= {arXiv preprint arXiv:2409.14447},
year = {2024}
}
备注
To appear at the International Conference for High Performance Computing, Networking, Storage, and Analysis (SC24)