面向 DNN 在 Arm Cortex-A CPU 上优化部署的自动化设计空间探索
机器学习
2020-12-29 v2 计算机视觉与模式识别
图像与视频处理
机器学习
摘要
深度学习在嵌入式设备上的普及促使了众多优化深度神经网络 (DNN) 部署方法的发展。已有工作主要关注:i) 高效 DNN 架构,ii) 剪枝和量化等网络优化技术,iii) 加速最计算密集型层执行的优化算法,以及 iv) 加速数据流和计算的专用硬件。然而,跨层优化研究匮乏,因为方法空间过大而无法测试并获得全局优化解。从而导致在延迟、精度和内存方面次优的部署。本工作中,我们首先详述并分析跨不同软件优化层级改进 DNN 部署的方法。基于此认识,我们提出一个自动化探索框架以简化 DNN 部署。该框架依赖强化学习搜索,结合深度学习推理框架,自动探索设计空间并学习优化解,从而加速嵌入式 CPU 平台上的性能并减少内存。因此,我们给出一系列在多种 Arm Cortex-A CPU 平台上最先进 DNN 的结果,相对于 BLAS 浮点实现实现了高达 4 倍性能提升和超过 2 倍内存减少,且精度损失可忽略。
引用
@article{arxiv.2006.05181,
title = {Automated Design Space Exploration for optimised Deployment of DNN on Arm Cortex-A CPUs},
author = {Miguel de Prado and Andrew Mundy and Rabia Saeed and Maurizio Denna and Nuria Pazos and Luca Benini},
journal= {arXiv preprint arXiv:2006.05181},
year = {2020}
}