中文

知晓看什么、在哪看与何时看:基于注意力的高效视频动作建模

计算机视觉与模式识别 2020-04-06 v1

摘要

由于无约束视频在时空上信息丰富却冗余,注意力视频建模对于动作识别至关重要。然而,在用于动作识别的深度神经网络中引入注意力面临两个挑战。首先,有效的注意力模块需学习关注什么(物体及其局部运动模式)、在哪里(空间上)以及何时(时间上)。其次,视频注意力模块必须高效,因为现有动作识别模型已饱受高计算成本之苦。为应对这两大挑战,我们提出了一种新颖的 What-Where-When(W3)视频注意力模块。与现有方案不同,我们的 W3 模块联合建模视频注意力的所有三个方面。关键在于,它通过将高维视频特征数据分解为低维有意义空间(用于“什么”的 1D 通道向量与用于“哪里”的 2D 空间张量),继而进行轻量级时间注意力推理,从而实现极高效率。大量实验表明,我们的注意力模型为现有动作识别模型带来显著提升,在多个基准上取得新的 SOTA 性能。

关键词

引用

@article{arxiv.2004.01278,
  title  = {Knowing What, Where and When to Look: Efficient Video Action Modeling with Attention},
  author = {Juan-Manuel Perez-Rua and Brais Martinez and Xiatian Zhu and Antoine Toisoul and Victor Escorcia and Tao Xiang},
  journal= {arXiv preprint arXiv:2004.01278},
  year   = {2020}
}