中文

Gate-Shift-Fuse用于视频动作识别

计算机视觉与模式识别 2023-04-18 v3

摘要

卷积神经网络是图像识别的事实标准模型。然而,作为2D CNN在视频识别中直接扩展的3D CNN,在标准动作识别基准上并未取得同等成功。3D CNN性能下降的主要原因之一是计算复杂度增加,需要大规模标注数据集才能对其进行规模化训练。已有3D核分解方法被提出以降低3D CNN的复杂度。现有核分解方法遵循手工设计且固化的技术。本文提出Gate-Shift-Fuse(GSF),一种新颖的时空特征提取模块,其控制时空分解中的交互,并学习以数据依赖的方式自适应地沿时间路由特征并加以组合。GSF利用分组空间门控分解输入张量,并通过通道加权融合分解后的张量。GSF可插入现有2D CNN中,将其转化为高效且高性能的时空特征提取器,且参数与计算开销可忽略。我们使用两个流行的2D CNN系列对GSF进行了充分分析,并在五个标准动作识别基准上取得了最先进或具竞争力的性能。

关键词

引用

@article{arxiv.2203.08897,
  title  = {Gate-Shift-Fuse for Video Action Recognition},
  author = {Swathikiran Sudhakaran and Sergio Escalera and Oswald Lanz},
  journal= {arXiv preprint arXiv:2203.08897},
  year   = {2023}
}

备注

Accepted to TPAMI. arXiv admin note: text overlap with arXiv:1912.00381