中文

GCF-Net:用于视频动作识别的门控片段融合网络

计算机视觉与模式识别 2021-02-03 v1

摘要

近年来,视频动作识别准确率的大部分提升来自于新设计的 CNN 架构(例如 3D-CNN)。这些模型通过在固定时间长度的单个片段上应用深度 CNN 进行训练。由于每个视频段均由 3D-CNN 模块单独处理,相应的片段描述子是局部的,且片段间关系本质上是隐式的。直接将片段级输出平均作为视频级预测的常见方法容易失败,因为缺乏能够提取并整合相关信息来表示视频的机制。在本文中,我们引入了门控片段融合网络(GCF-Net),它能以极小的计算开销大幅增强现有的视频动作分类器。GCF-Net 显式建模视频片段间的相互依赖关系,以增强局部片段描述子的感受野。此外,计算出每个片段对动作事件的重要性,并据此选择相关片段子集用于视频级分析。在大型基准数据集(Kinetics-600)上,所提出的 GCF-Net 将现有动作分类器的准确率分别提升了 11.49%(基于中心片段)和 3.67%(基于密集采样片段)。

关键词

引用

@article{arxiv.2102.01285,
  title  = {GCF-Net: Gated Clip Fusion Network for Video Action Recognition},
  author = {Jenhao Hsiao and Jiawei Chen and Chiuman Ho},
  journal= {arXiv preprint arXiv:2102.01285},
  year   = {2021}
}