DNN 推理吞吐量最大化:批处理还是多租户?
分布式、并行与集群计算
2023-08-29 v1
摘要
在仓储级基础设施上部署实时 ML 服务日益增多。因此,降低赋能这些服务的深度神经网络(DNN)推理应用的延迟并提升其吞吐量,已引起学术界与工业界的关注。解决该挑战的常用方案是利用 GPU 等硬件加速器。为提升部署于 GPU 加速器上的 DNN 推理吞吐量,通常采用两种方法:批处理(Batching)与多租户(Multi-Tenancy)。我们的初步实验表明,这些方法对吞吐量的影响取决于 DNN 架构。鉴于此观察,我们设计实现了 DNNScaler,旨在满足交互式 AI 驱动服务的延迟要求的同时最大化其吞吐量。DNNScaler 首先检测对某一 DNN 在吞吐量提升上最有益的合适方法(批处理或多租户);随后,调整所检测方法的控制旋钮(批处理对应批大小,多租户对应共置实例数),在维持延迟的同时提高吞吐量。使用来自多个领域的知名 DNN、若干流行数据集及前沿 GPU 开展大量实验,结果表明:与已有方案相比,DNNScaler 在满足服务延迟要求的同时,吞吐量最高提升 14 倍(平均提升 218%)。
引用
@article{arxiv.2308.13803,
title = {Throughput Maximization of DNN Inference: Batching or Multi-Tenancy?},
author = {Seyed Morteza Nabavinejad and Masoumeh Ebrahimi and Sherief Reda},
journal= {arXiv preprint arXiv:2308.13803},
year = {2023}
}