中文

用于动作识别的时间区分性表示学习

计算机视觉与模式识别 2020-07-16 v1

摘要

受二维卷积神经网络(2D CNN)在图像识别上以往成功的启发,研究者致力于利用它来刻画视频。然而,将 2D CNN 应用于视频分析的一个局限是,视频的不同帧共享相同的 2D CNN 卷积核,这可能导致重复和冗余的信息利用,尤其在空间语义提取过程中,从而忽略了帧间的关键变化。本文尝试通过两种途径解决该问题。1)设计一种顺序通道过滤机制,即渐进增强模块(PEM),逐步激发来自不同帧特征的判别性通道,从而避免重复信息提取。2)创建时间多样性损失(TD Loss),迫使卷积核聚焦于并捕获帧间变化而非具有相似外观的图像区域。我们的方法在时序推理基准数据集 Something-Something V1 和 V2 上进行了评估,分别比较最佳竞争者取得了 2.4% 和 1.3% 的明显提升。此外,在大规模数据集 Kinetics 上基于 2D-CNN 的现有最佳方法也观察到了性能提升。

关键词

引用

@article{arxiv.2007.07626,
  title  = {Temporal Distinct Representation Learning for Action Recognition},
  author = {Junwu Weng and Donghao Luo and Yabiao Wang and Ying Tai and Chengjie Wang and Jilin Li and Feiyue Huang and Xudong Jiang and Junsong Yuan},
  journal= {arXiv preprint arXiv:2007.07626},
  year   = {2020}
}

备注

16 pages, 4 figures, 7 tables