TEINet:面向高效视频识别的架构设计
计算机视觉与模式识别
2019-11-22 v1
摘要
效率是设计视频动作识别架构中的重要问题。3D CNN在视频动作识别中取得了显著进展。然而,与2D对应结构相比,3D卷积常引入大量参数并导致高计算成本。为缓解该问题,我们提出一种高效时序模块,称为时序增强与交互模块(TEI Module),可插入现有2D CNN中(记为TEINet)。TEI模块通过解耦通道相关性建模与 temporal 交互建模,提出了一种学习时序特征的不同范式。首先,它包含一个运动增强模块(MEM),用于增强运动相关特征并抑制无关信息(如背景)。然后,它引入一个时序交互模块(TIM),以通道方式补充时序上下文信息。这种两阶段建模方案不仅能灵活有效地捕捉时序结构,而且模型推理高效。我们进行了大量实验在多个基准(如Something-Something V1&V2、Kinetics、UCF101和HMDB51)上验证TEINet的有效性。我们提出的TEINet在这些数据集上能取得良好识别精度,同时保持高效率。
引用
@article{arxiv.1911.09435,
title = {TEINet: Towards an Efficient Architecture for Video Recognition},
author = {Zhaoyang Liu and Donghao Luo and Yabiao Wang and Limin Wang and Ying Tai and Chengjie Wang and Jilin Li and Feiyue Huang and Tong Lu},
journal= {arXiv preprint arXiv:1911.09435},
year = {2019}
}
备注
Accepted by AAAI 2020