iGniter:面向云中可预测 DNN 推理的干扰感知 GPU 资源供给
分布式、并行与集群计算
2022-11-04 v1
摘要
GPU 对于加速云数据中心中延迟敏感的深度神经网络(DNN)推理工作负载至关重要。为充分利用 GPU 资源,共置 DNN 推理工作负载间的 GPU 空间共享变得越来越有吸引力。然而,正如在 EC2 GPU 实例上针对 DNN 推理的实证测量研究所示,GPU 共享不可避免地带来共置推理工作负载间严重的性能干扰。现有关于保障推理性能服务级别目标(SLOs)的工作要么聚焦于 GPU 的时间共享,要么聚焦于被动式 GPU 资源伸缩与推理迁移技术,而如何主动缓解此类严重性能干扰则受到相对较少的关注。本文中,我们提出 iGniter,一种干扰感知的 GPU 资源供给框架,用于以高成本效益实现云中可预测的 DNN 推理。iGniter 由两个关键组件构成:(1)一个轻量级 DNN 推理性能模型,其利用实际可获取的系统与工作负载指标来捕捉性能干扰;(2)一种高成本效益的 GPU 资源供给策略,基于我们的推理性能模型联合优化 GPU 资源分配与自适应批处理,旨在实现 DNN 推理工作负载的可预测性能。我们基于托管在 EC2 GPU 实例上的 NVIDIA Triton 推理服务器实现了 iGniter 的原型。在四种代表性 DNN 模型与数据集上的大量原型实验表明,iGniter 能以实际可接受的运行时开销保障 DNN 推理工作负载的性能 SLOs,同时与最先进的 GPU 资源供给策略相比最高节省 25% 的货币成本。
引用
@article{arxiv.2211.01713,
title = {iGniter: Interference-Aware GPU Resource Provisioning for Predictable DNN Inference in the Cloud},
author = {Fei Xu and Jianian Xu and Jiabin Chen and Li Chen and Ruitao Shang and Zhi Zhou and Fangming Liu},
journal= {arXiv preprint arXiv:2211.01713},
year = {2022}
}
备注
16 pages, 21 figures, submitted to IEEE Transactions on Parallel and Distributed Systems