中文

使用多实例GPU服务DNN模型:可重构机器调度问题的一个案例

分布式、并行与集群计算 2021-09-24 v1 机器学习

摘要

多实例GPU(MIG)是NVIDIA A100 GPU引入的一项新特性,可将一个物理GPU划分为多个GPU实例。借助MIG,A100可成为服务于深度神经网络(DNNs)最具成本效益的GPU。然而,发现最高效的GPU划分方式具有挑战性。其底层问题是NP难的;此外,它是一个新的抽象问题,我们将其定义为可重构机器调度问题(RMS)。本文研究使用MIG服务DNNs,这是RMS的一个新案例。我们进一步提出了一种解决方案MIG-serving。MIG-serving是一个算法流水线,融合了多种新设计的算法和定制的经典算法,包括启发式贪心算法、遗传算法(GA)和蒙特卡洛树搜索算法(MCTS)。我们在Kubernetes上实现了MIG-serving。实验表明,与使用原始A100相比,MIG-serving在提供相同吞吐量的同时最多可节省40%的GPU。

关键词

引用

@article{arxiv.2109.11067,
  title  = {Serving DNN Models with Multi-Instance GPUs: A Case of the Reconfigurable Machine Scheduling Problem},
  author = {Cheng Tan and Zhichao Li and Jian Zhang and Yu Cao and Sikai Qi and Zherui Liu and Yibo Zhu and Chuanxiong Guo},
  journal= {arXiv preprint arXiv:2109.11067},
  year   = {2021}
}