利用Tucker分解压缩视频CNN核:迈向轻量化CNN应用
机器学习
2022-07-06 v1 人工智能
计算机视觉与模式识别
图像与视频处理
摘要
卷积神经网络(CNN)是视觉计算领域的最先进技术。然而,CNN的一个主要问题是对大输入执行卷积所需的大量浮点运算(FLOPs)。当考虑将CNN应用于视频数据时,由于额外的时间维度,卷积滤波器变得更加复杂。这导致相应应用部署于移动设备(如智能手机、平板电脑、微控制器或类似计算能力较弱的设备)时出现问题。Kim等人(2016)提出使用Tucker分解压缩预训练图像网络的卷积核,以降低网络的复杂度,即FLOPs数量。在本文中,我们将上述方法推广到视频(及其他3D信号)应用,并在修改后的THETIS数据集上评估所提方法,该数据集包含个人进行网球击球动作的视频。我们表明压缩网络达到了可比的精度,同时实现了51倍的内存压缩。然而,实际的计算加速(1.4倍)未达到我们理论推导的预期(6倍)。
引用
@article{arxiv.2203.07033,
title = {Compressing CNN Kernels for Videos Using Tucker Decompositions: Towards Lightweight CNN Applications},
author = {Tobias Engelhardt Rasmussen and Line H Clemmensen and Andreas Baum},
journal= {arXiv preprint arXiv:2203.07033},
year = {2022}
}
备注
Presented at the Northern Lights Deep Learning Conference 2022 in Troms{\o}, Norway