中文

受共分割启发的注意力模块用于基于视频的计算机视觉任务

计算机视觉与模式识别 2022-08-03 v3

摘要

基于视频的计算机视觉任务可从显著区域估计及这些区域间交互中获益。传统上,这是通过利用预训练模型执行目标检测、目标分割和/或目标姿态估计来识别图像中的目标区域完成的。尽管使用预训练模型是一种可行方法,但它在需要详尽标注目标类别、数据集间可能存在的域差距以及预训练模型中通常存在的偏置等方面存在若干局限。在本工作中,我们提出利用一种共同原理:视频帧序列捕捉一组共同目标及其间的交互,因此视频帧特征间的共分割概念可使模型自动聚焦于任务特定的显著区域,并以端到端方式提升底层任务性能。为此,我们提出一个名为“受共分割启发的注意力模块”(COSAM)的通用模块,可插入任意 CNN 模型以在视频帧特征序列中增强基于共分割的注意力。我们展示了 COSAM 在三个基于视频的任务中的应用,即:1) 基于视频的人员重识别,2) 视频字幕生成,以及 3) 视频动作分类,并证明 COSAM 能够捕捉视频帧中任务特定的显著区域,从而带来显著性能提升及可解释的注意力图,适用于多种基于视频的视觉任务,并可能应用于其他基于视频的视觉任务。

关键词

引用

@article{arxiv.2111.07370,
  title  = {Co-segmentation Inspired Attention Module for Video-based Computer Vision Tasks},
  author = {Arulkumar Subramaniam and Jayesh Vaidya and Muhammed Abdul Majeed Ameen and Athira Nambiar and Anurag Mittal},
  journal= {arXiv preprint arXiv:2111.07370},
  year   = {2022}
}

备注

26 pages, 14 figures, Preprint submitted to CVIU journal