RT3D:在移动设备上实现3D卷积神经网络的实时执行
机器学习
2021-01-05 v2 计算机视觉与模式识别
神经与进化计算
图像与视频处理
摘要
移动设备正成为深度学习任务的重要载体,因其配备了强大的高端移动CPU和GPU。然而,除了高推理精度外,实现面向实时性能的3D卷积神经网络(CNNs)执行仍是一项挑战性任务。原因在于更复杂的模型结构与更高的模型维度压垮了移动设备上可用的计算/存储资源。一种自然的方式可能是求助于深度学习权重剪枝技术。然而,现有2D CNN权重剪枝方法向3D CNNs的直接推广,在充分挖掘移动并行性同时实现高推理精度方面并不理想。本文提出RT3D,一种面向3D CNNs的模型压缩与移动加速框架,无缝集成神经网络权重剪枝与编译器代码生成技术。我们提出并研究了两种对移动加速友好的结构化稀疏方案,即原始结构化稀疏与核组结构化(KGS)稀疏。原始稀疏移除整个核组,而KGS稀疏是一种更细粒度的结构化稀疏,在利用全设备并行性的同时享有更高灵活性。我们提出一种重加权正则化剪枝算法以实现所提稀疏方案。由稀疏带来的推理时间加速比接近整个模型FLOPs(浮点运算数)的剪枝率。RT3D相较于当前支持3D CNNs的移动框架,端到端推理时间最高加速29.1,且仅有1%-1.5%的中等精度损失。在手机上执行代表性C3D和R(2+1)D模型时,16帧视频的端到端推理时间可在150 ms以内。首次在现成移动设备上实现了3D CNNs的实时执行。
引用
@article{arxiv.2007.09835,
title = {RT3D: Achieving Real-Time Execution of 3D Convolutional Neural Networks on Mobile Devices},
author = {Wei Niu and Mengshu Sun and Zhengang Li and Jou-An Chen and Jiexiong Guan and Xipeng Shen and Yanzhi Wang and Sijia Liu and Xue Lin and Bin Ren},
journal= {arXiv preprint arXiv:2007.09835},
year = {2021}
}
备注
To appear in Proceedings of the 35th AAAI Conference on Artificial Intelligence (AAAI-21)