面向动作识别的全面运动表征学习
计算机视觉与模式识别
2021-03-24 v1
摘要
对于动作识别学习,基于 2D CNN 的方法高效,但由于对每帧施加相同的 2D 卷积核可能产生冗余特征。近期研究尝试通过建立帧间连接来捕获运动信息,但仍受限于时序感受野不足或高延迟。此外,在动作识别中特征增强往往仅通过通道或空间维度进行。为解决这些问题,我们首先设计通道级运动增强(CME)模块,利用通道门向量自适应地强化与动态信息相关的通道。CME 生成的通道门融合了视频中所有其他帧的信息。我们进一步提出空间级运动增强(SME)模块,依据相邻特征图间的逐点相似性聚焦于运动中的关键目标区域。其直觉在于背景变化通常慢于运动区域。CME 与 SME 在捕获动作线索方面均具有明确的物理意义。通过将两模块集成至现成的 2D 网络中,我们最终得到一种用于动作识别的全面运动表征(CMR)学习方法,其在 Something-Something V1 与 V2 及 Kinetics-400 上取得了具竞争力的性能。在时序推理数据集 Something-Something V1 和 V2 上,当以 16 帧作为输入时,我们的方法分别超越当前最优方法 2.3% 与 1.9%。
引用
@article{arxiv.2103.12278,
title = {Learning Comprehensive Motion Representation for Action Recognition},
author = {Mingyu Wu and Boyuan Jiang and Donghao Luo and Junchi Yan and Yabiao Wang and Ying Tai and Chengjie Wang and Jilin Li and Feiyue Huang and Xiaokang Yang},
journal= {arXiv preprint arXiv:2103.12278},
year = {2021}
}
备注
Accepted by AAAI21