用于视频动作识别的可解释时空注意力
计算机视觉与模式识别
2019-06-04 v2 机器学习
机器学习
摘要
受人类能够仅通过关注所需的时间和空间位置来高效处理视频这一观察的启发,我们提出了一种可解释且易于插入的视频动作识别时空注意力机制。对于空间注意力,我们学习一个显著性掩码,使模型聚焦于特征图中最显著的部分。对于时间注意力,我们采用基于卷积 LSTM 的注意力机制来识别输入视频中最相关的帧。此外,我们提出一组正则化项以确保我们的注意力机制在时间和空间上关注连贯的区域。我们的模型不仅提高了视频动作识别准确率,还能在空间和时间上定位判别性区域,尽管仅以仅有分类标签的弱监督方式训练(无边界框标签或时间帧标签)。我们在多个公开视频动作识别数据集上通过消融研究评估了我们的方法。此外,我们定量和定性地评估了模型在空间上定位判别性区域和在时间上定位关键帧的能力。实验结果表明了我们方法的有效性,在与最先进方法相比具有优越或相当准确率的同时提高了模型可解释性。
引用
@article{arxiv.1810.04511,
title = {Interpretable Spatio-temporal Attention for Video Action Recognition},
author = {Lili Meng and Bo Zhao and Bo Chang and Gao Huang and Wei Sun and Frederich Tung and Leonid Sigal},
journal= {arXiv preprint arXiv:1810.04511},
year = {2019}
}