中文

TSI:用于视频动作识别的时间显著性整合

计算机视觉与模式识别 2021-12-20 v4

摘要

高效的时空建模是视频动作识别中一个重要且具有挑战性的问题。现有最先进方法利用相邻特征差异,通过简单卷积获取短期时间建模的运动线索。然而,单一局部卷积由于感受野有限,无法处理各类动作。此外,相机运动带来的与动作无关的噪声也会损害所提取运动特征的质量。本文提出一种时间显著性整合(TSI)模块,主要包含显著性运动激励(SME)模块和跨感知时间整合(CTI)模块。具体而言,SME 旨在通过空间级局部-全局运动建模突出运动敏感区域,其中在相邻帧间依次进行显著性对齐与金字塔运动建模,以在较少由未对齐背景引起的噪声下捕获运动动态。CTI 设计用于通过一组分离的 1D 卷积分别执行多感知时间建模。同时,不同感知间的时间交互通过注意力机制进行整合。通过这两个模块,可在引入有限额外参数下高效编码长短时时间关系。在多个流行基准(即 Something-Something V1 与 V2、Kinetics-400、UCF-101 和 HMDB-51)上的大量实验证明了所提方法的有效性。

关键词

引用

@article{arxiv.2106.01088,
  title  = {TSI: Temporal Saliency Integration for Video Action Recognition},
  author = {Haisheng Su and Kunchang Li and Jinyuan Feng and Dongliang Wang and Weihao Gan and Wei Wu and Yu Qiao},
  journal= {arXiv preprint arXiv:2106.01088},
  year   = {2021}
}

备注

Submitted to CVPR 2022