一种面向集成 GPU 上 CNN 模型推理的统一优化方法
分布式、并行与集群计算
2019-07-05 v1
摘要
现代深度学习应用出于缩短延迟、减轻连接云端的网络负担以及保护用户隐私等多种原因,迫切需要将模型推理推至边缘设备上进行。卷积神经网络(CNN)是这些应用中使用最广泛的模型族之一。鉴于 CNN 模型的高计算复杂度,宜将其运行于边缘设备的集成 GPU 上,这类 GPU ubiquitous 且相比 accompanying CPU 具有更强算力与更高能效。然而,由于集成 GPU 架构与编程接口多样,在其上高效编程颇具挑战。本文提出一种端到端方案,用于在边缘集成 GPU 上执行 CNN 模型推理,该方案使用统一的中间表示(IR)来刻画并优化来自多家厂商的集成 GPU 上的视觉专用算子,并利用基于机器学习的调度搜索方案来优化卷积等计算密集型算子。我们的方案甚至为不适合或不便在 GPU 上运行的算子提供了回退机制。评估结果表明,相较于由 Intel Graphics、ARM Mali GPU 与 Nvidia 集成 Maxwell GPU 上厂商提供的高性能库所支撑的先进方案,我们的方案在多个流行图像分类与目标检测模型上取得了相近甚至更优(最高 1.62)的性能。此外,我们的方案具有更广的模型覆盖度,并能更灵活地接纳新模型。我们的方案已被 AWS 的生产服务采用并开源。
引用
@article{arxiv.1907.02154,
title = {A Unified Optimization Approach for CNN Model Inference on Integrated GPUs},
author = {Leyuan Wang and Zhi Chen and Yizhi Liu and Yao Wang and Lianmin Zheng and Mu Li and Yida Wang},
journal= {arXiv preprint arXiv:1907.02154},
year = {2019}
}
备注
10 pages, 3 figures, 48th International Conference on Parallel Processing