提升边缘设备上的 DNN 冷推理性能
机器学习
2023-08-29 v2
摘要
如今 DNN 在边缘设备上无处不在。随着其重要性与用例的增长,不太可能将所有 DNN 装入设备内存并期望每次推理均已预热。因此,冷推理——即读取、初始化并执行 DNN 模型的过程——正变得普遍,其性能亟待优化。为此,我们提出 NNV12,首个面向冷推理优化的设备上推理引擎。NNV12 构建于三个新颖的优化旋钮之上:为每个 DNN 算子选择合适的核(实现)、通过磁盘缓存变换后权重以绕过权重变换过程,以及在非对称处理器上对多个核进行流水线执行。为应对巨大的搜索空间,NNV12 采用基于启发式的方案以获得近最优的核调度计划。我们完整实现了 NNV12 原型,并通过大量实验评估其性能。结果表明,相较于边缘 CPU 与 GPU 上最先进的 DNN 引擎,NNV12 分别实现了高达 15.2 倍与 401.5 倍的提升。
引用
@article{arxiv.2206.07446,
title = {Boosting DNN Cold Inference on Edge Devices},
author = {Rongjie Yi and Ting Cao and Ao Zhou and Xiao Ma and Shangguang Wang and Mengwei Xu},
journal= {arXiv preprint arXiv:2206.07446},
year = {2023}
}