用于视频动作识别的门控移位网络
计算机视觉与模式识别
2020-03-24 v2
摘要
用于视频动作识别的深度 3D CNN 旨在联合时空特征空间中学习强大的表示。然而在实践中,由于涉及大量参数与计算,在缺乏足够大规模训练数据集时其性能可能不佳。本文在 3D 核的时空分解中引入空间门控。我们使用门控移位模块(GSM)实现该概念。GSM 轻量且将 2D-CNN 转变为高效的时空特征提取器。插入 GSM 后,2D-CNN 学会以几乎无额外参数与计算开销的方式自适应地沿时间路由特征并对其进行组合。我们对所提模块进行了广泛评估以研究其在视频动作识别中的有效性,在 Something Something-V1 和 Diving48 数据集上取得了最先进的结果,并以远低的模型复杂度在 EPIC-Kitchens 上获得了有竞争力的结果。
引用
@article{arxiv.1912.00381,
title = {Gate-Shift Networks for Video Action Recognition},
author = {Swathikiran Sudhakaran and Sergio Escalera and Oswald Lanz},
journal= {arXiv preprint arXiv:1912.00381},
year = {2020}
}
备注
CVPR20 camera ready version. Code and models available at https://github.com/swathikirans/GSM