中文

超越推理:深度神经网络服务器开销的性能分析

分布式、并行与集群计算 2024-04-23 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

深度神经网络(DNN)推理已成为许多数据中心工作负载的重要组成部分。这促使设计越来越快的深度学习加速器,如 GPU 和 TPU。然而,基于 DNN 的视觉应用程序不仅仅包含 DNN 推理,还包括输入解压、调整大小、抽样、归一化和数据传输。在本文中,我们对在吞吐量优化的 serving 系统上执行的计算机视觉推理请求进行了彻底的评估。我们量化了服务器开销(如数据移动、预处理和消息代理)的性能影响,这些开销在两个不同速率输出的 DNN 之间存在差异。我们的实证分析涵盖许多计算机视觉任务,包括图像分类、分割、检测、深度估计以及多个 DNN 的更复杂处理管道。我们的结果一致显示,端到端应用程序性能可以轻易被数据处理和数据移动功能所主导(在中等大小的图像中,端到端延迟可达 56%,在大图像中系统吞吐量影响可达约 80%),尽管这些功能在深度学习系统设计中通常被忽视。我们的工作识别了不同应用场景中的重要性能瓶颈,实现了比以前工作高 2.25 倍的吞吐量,并为更全面的深度学习系统设计铺平了道路。

关键词

引用

@article{arxiv.2403.12981,
  title  = {Beyond Inference: Performance Analysis of DNN Server Overheads for Computer Vision},
  author = {Ahmed F. AbouElhamayed and Susanne Balle and Deshanand Singh and Mohamed S. Abdelfattah},
  journal= {arXiv preprint arXiv:2403.12981},
  year   = {2024}
}

备注

6 pages, 11 figures, DAC 2024: 61st IEEE/ACM Design Automation Conference. (DAC'24)