中文

通过最大化深度3D CNN的时空熵实现高效视频识别

计算机视觉与模式识别 2023-03-07 v1 机器学习

摘要

三维卷积神经网络(CNNs)一直是视频识别的主流选择。为捕获时间信息,三维卷积沿序列计算,导致计算量呈立方增长且代价高昂。为降低计算成本,以往方法借助手动设计的带近似的三维/二维CNN结构或自动搜索,这牺牲了建模能力或使训练耗时。本工作中,我们提出通过一种专为三维CNN设计、考虑模型复杂度的新颖免训练神经架构搜索方法,自动设计高效的三维CNN架构。为高效度量三维CNN的表达能力,我们将三维CNN表述为信息系统并基于最大熵原理推导出解析熵分数。具体而言,我们提出一种带细化因子的时空熵分数(STEntr-Score),通过深度方向上动态利用特征图尺寸与核尺寸的相关性,处理空间与时间维度上视觉信息的差异。然后,可在给定计算预算下,通过进化算法无需训练网络参数,以最大化STEntr-Score高效搜索得到高效且具表达力的三维CNN架构,即基于熵的三维CNN(E3D系列)。在Something-Something V1&V2和Kinetics400上的大量实验表明,E3D系列以更高的计算效率取得了最先进的性能。代码见https://github.com/alibaba/lightweight-neural-architecture-search。

关键词

引用

@article{arxiv.2303.02693,
  title  = {Maximizing Spatio-Temporal Entropy of Deep 3D CNNs for Efficient Video Recognition},
  author = {Junyan Wang and Zhenhong Sun and Yichen Qian and Dong Gong and Xiuyu Sun and Ming Lin and Maurice Pagnucco and Yang Song},
  journal= {arXiv preprint arXiv:2303.02693},
  year   = {2023}
}

备注

This manuscript has been accepted at ICLR 2023