中文

学习时空自相似性作为视频动作识别的广义运动

计算机视觉与模式识别 2021-11-03 v3

摘要

时空卷积往往无法学习视频中的运动动态,因此需要一种有效的运动表示用于真实场景下的视频理解。本文中,我们提出一种基于时空自相似性(STSS)的丰富且鲁棒的运动表示。给定一帧序列,STSS 将每个局部区域表示为其与时空邻域的相似性。通过将外观特征转换为关系值,它使学习者能更好地识别时空中的结构模式。我们利用 STSS 的整个体数据,并让我们的模型从中学习提取有效的运动表示。所提出的神经模块称为 SELFY,可轻松插入神经网络架构中并端到端训练而无需额外监督。在充足的时空邻域体量下,它有效捕获视频中的长时交互与快速运动,从而实现鲁棒的动作识别。我们的实验分析证明了其相对于先前运动建模方法的优越性,以及与直接卷积得到的时空特征的互补性。在标准动作识别基准 Something-Something-V1 & V2、Diving-48 和 FineGym 上,所提方法取得了最先进的(SOTA)结果。

关键词

引用

@article{arxiv.2102.07092,
  title  = {Learning Self-Similarity in Space and Time as Generalized Motion for Video Action Recognition},
  author = {Heeseung Kwon and Manjin Kim and Suha Kwak and Minsu Cho},
  journal= {arXiv preprint arXiv:2102.07092},
  year   = {2021}
}

备注

Accepted to ICCV 2021