中文

面向基于视频的动作识别的运动驱动视觉节奏学习

计算机视觉与模式识别 2022-07-13 v2

摘要

动作视觉节奏刻画了动作的动态特性与时间尺度,有助于区分在视觉动态与外观上高度相似的人体动作。以往方法要么以多种速率对原始视频进行采样(需要代价高昂的多层网络来处理每个速率),要么对骨干网络特征进行分层采样(严重依赖高层特征而遗漏细粒度时间动态)。本工作中,我们提出一种时间关联模块(Temporal Correlation Module, TCM),它可以便插即用的方式轻松嵌入现有动作识别骨干网络,在单层从低层骨干特征中显著提取动作视觉节奏。具体而言,我们的 TCM 包含两个主要组件:多尺度时间动态模块(Multi-scale Temporal Dynamics Module, MTDM)与时间注意力模块(Temporal Attention Module, TAM)。MTDM 应用关联操作来学习快节奏与慢节奏的像素级细粒度时间动态。TAM 通过分析跨不同节奏的全局信息,自适应地增强具表现力的特征并抑制非必要特征。在多个动作识别基准(如 Something-Something V1 &\& V2、Kinetics-400、UCF-101 与 HMDB-51)上开展的广泛实验表明,所提出的 TCM 能大幅提升现有基于视频的动作识别模型的性能。源代码已公开发布于 https://github.com/yzfly/TCM。

关键词

引用

@article{arxiv.2202.12116,
  title  = {Motion-driven Visual Tempo Learning for Video-based Action Recognition},
  author = {Yuanzhong Liu and Junsong Yuan and Zhigang Tu},
  journal= {arXiv preprint arXiv:2202.12116},
  year   = {2022}
}

备注

Accpted by IEEE Transactions on Image Processing(TIP), 2022