中文

一种高效且灵活的用于服务异构深度神经网络集成体的推理系统

分布式、并行与集群计算 2022-08-31 v1 机器学习

摘要

深度神经网络(DNN)集成体已实现高质量的预测,但它们计算和内存开销巨大。因此,日益增长的需求是使其利用可用计算资源应对繁重的需求负载。与近期聚焦于单一DNN预测的推理服务器和推理框架不同,我们提出了一种新的软件层,以灵活且高效的方式服务DNN集成体。我们的推理系统设计了若干技术创新。首先,我们提出了一种新颖流程,用于寻找设备(CPU或GPU)与DNN实例之间的良好分配矩阵。它依次运行最坏适配(worst-fit)以将DNN分配至内存设备,以及一种贪心算法以优化分配设置并加速集成体。其次,我们基于多进程设计了推理系统以异步运行:批处理、预测以及组合规则,并采用高效的内部通信方案以避免开销。实验展示了极端场景下的灵活性与效率:它成功将12个重型DNN的集成体部署于4块GPU上,反之,也可将单个DNN多线程部署于16块GPU。在图像分类任务上,它还以最高2.7倍的加速优于通过优化DNN批大小构成的简单基线。

关键词

引用

@article{arxiv.2208.14049,
  title  = {An efficient and flexible inference system for serving heterogeneous ensembles of deep neural networks},
  author = {Pierrick Pochelu and Serge G. Petiton and Bruno Conche},
  journal= {arXiv preprint arXiv:2208.14049},
  year   = {2022}
}