中文

通过动态多实例GPU重配置提升GPU多租户性能

分布式、并行与集群计算 2024-07-19 v1

摘要

持续学习(CL)已成为部署在现代云GPU中最流行的深度学习范式之一。具体而言,CL有能力持续更新模型参数(通过模型重训练),并使用更新后的模型(如果可用)来服务随时间到达的推理请求。通常,将重训练和推理共同部署在一起是有益的,以实现及时的模型更新并避免模型传输开销。这带来了在重训练和推理之间共享GPU的需求。同时,多个CL工作负载可以共享云中的现代GPU,导致多租户执行。在本文中,我们观察到先前的GPU共享技术并未针对多租户CL工作负载进行优化。具体来说,它们没有连贯地考虑重训练模型的准确性和推理服务水平目标(SLO)的达成情况。此外,它们无法适应CL执行中的动态变化(例如,推理到达强度)。在本文中,我们提出了MIGRator,一种新颖的GPU重配置运行时,它为多租户CL工作负载动态执行GPU重配置。MIGRator基于最近的NVIDIA多实例GPU(MIG)技术来缓解资源争用,并将重配置优化问题形式化为整数线性规划(ILP),以动态识别、重配置和分配GPU实例。MIGRator在ILP目标函数中利用“有效吞吐量(Goodput)”指标,以在重配置探索中同时考虑推理SLO达成情况和模型准确性。我们使用代表性的多租户CL工作负载评估了MIGRator。结果表明,我们的方法分别比最先进的GPU共享技术(即Ekya、Astraea和PARIS)性能高出17%、21%和20%。

关键词

引用

@article{arxiv.2407.13126,
  title  = {Improving GPU Multi-Tenancy Through Dynamic Multi-Instance GPU Reconfiguration},
  author = {Tianyu Wang and Sheng Li and Bingyao Li and Yue Dai and Ao Li and Geng Yuan and Yufei Ding and Youtao Zhang and Xulong Tang},
  journal= {arXiv preprint arXiv:2407.13126},
  year   = {2024}
}