M2A:用于精确视频动作识别的运动感知注意力
计算机视觉与模式识别
2021-12-14 v2
摘要
注意力机制的进展因其在时序序列动态建模上的能力,在机器学习诸多领域带来了显著的性能提升。计算机视觉中一个尤其可能从引入注意力机制中大幅受益的领域是视频动作识别。然而,当前许多关于注意力机制的研究聚焦于空间与时间注意力,无法利用视频中固有的运动信息。受此驱动,我们提出了一种称为运动感知注意力(M2A)的新注意力机制,其显式地融入运动特征。更具体地,M2A提取连续帧间的运动信息,并利用注意力聚焦于跨帧发现的运动模式,以精确识别视频中的动作。所提M2A机制实现简单,可轻松嵌入任意神经网络骨干架构。我们表明,使用所提M2A机制将运动机制与注意力机制结合,在不同骨干架构上可带来top-1准确率+15%至+26%的提升,且仅带来计算复杂度的微小增加。我们进一步在Something-Something V1视频动作识别基准上比较了M2A与其他最先进的运动与注意力机制。实验结果显示,M2A与其他时间机制结合可带来进一步提升,且对于基准中特定类别,其top-1准确率超越其他仅运动或仅注意力机制多达+60%。
引用
@article{arxiv.2111.09976,
title = {M2A: Motion Aware Attention for Accurate Video Action Recognition},
author = {Brennan Gebotys and Alexander Wong and David A. Clausi},
journal= {arXiv preprint arXiv:2111.09976},
year = {2021}
}