中文

堆叠时序注意:通过强调判别性片段改进第一人称动作识别

计算机视觉与模式识别 2021-12-03 v1

摘要

第一人称动作识别是视频理解中的一项挑战性任务。由于强烈的自我运动和有限的视野,第一人称视频中的许多背景或噪声帧会在学习过程中分散动作识别模型的注意力。为编码更具判别性的特征,模型需具备聚焦于视频中最相关部分的能力。已有工作尝试通过应用时序注意来解决该问题,但未能考虑完整视频的全局上下文,而这对确定相对重要部分至关重要。本工作中,我们提出一种简单而有效的堆叠时序注意模块(STAM),基于跨片段的全局知识计算时序注意以强调最具判别性的特征。我们通过堆叠多个自注意力层实现这一点。不同于被实验证明无效的朴素堆叠,我们精心设计每个自注意力层的输入,使视频的局部与全局上下文在生成时序注意权重时均被考虑。实验表明,我们提出的 STAM 可构建于大多数现有骨干网络之上,并在多个数据集上提升性能。

关键词

引用

@article{arxiv.2112.01038,
  title  = {Stacked Temporal Attention: Improving First-person Action Recognition by Emphasizing Discriminative Clips},
  author = {Lijin Yang and Yifei Huang and Yusuke Sugano and Yoichi Sato},
  journal= {arXiv preprint arXiv:2112.01038},
  year   = {2021}
}

备注

BMVC 2021