MixTConv:用于高效动作识别的混合时序卷积核
计算机视觉与模式识别
2020-01-28 v3
摘要
为高效提取视频的时空特征以进行动作识别,多数最先进方法将一维时序卷积集成到常规 2D CNN 骨干网络中。然而,它们在网络构建块中均使用固定核大小(即 3)的一维时序卷积,因而对长时与短时动作均具有次优的时序建模能力。为解决此问题,我们首先探究了不同核大小对一维时序卷积滤波器的影响。随后,我们提出一种简单而高效的操作,称为混合时序卷积(MixTConv),其由多个具有不同核大小的分组一维卷积滤波器组成。通过将 MixTConv 插入常规 2D CNN 骨干 ResNet-50,我们进一步提出了一种高效且有效的动作识别网络架构 MSTNet,并在多个基准上取得了最先进结果。
引用
@article{arxiv.2001.06769,
title = {MixTConv: Mixed Temporal Convolutional Kernels for Efficient Action Recogntion},
author = {Kaiyu Shan and Yongtao Wang and Zhuoying Wang and Tingting Liang and Zhi Tang and Ying Chen and Yangyan Li},
journal= {arXiv preprint arXiv:2001.06769},
year = {2020}
}
备注
None