用于视频识别的时间注意力协方差池化网络
计算机视觉与模式识别
2021-11-09 v3 机器学习
摘要
对于视频识别任务,总结视频片段整体内容的全局表示对最终性能起着重要作用。然而,现有的视频架构通常通过使用简单的全局平均池化(GAP)方法生成它,其捕获视频复杂动态的能力有限。对于图像识别任务,存在证据表明协方差池化比 GAP 具有更强的表示能力。遗憾的是,图像识别中使用的这种朴素协方差池化是无序表示,无法建模视频中固有的时空结构。因此,本文提出在时间注意力协方差池化(TCP),插入到深度架构末端,以产生强大的视频表示。具体地,我们的 TCP 首先开发时间注意力模块,为后续的协方差池化自适应校准时空特征,近似产生注意力协方差表示。然后,时间协方差池化对注意力协方差表示执行时间池化,以刻画校准特征的帧内相关性和帧间交叉相关性。如此,所提出的 TCP 能捕获复杂的时间动态。最后,引入快速矩阵幂归一化以利用协方差表示的几何性质。注意我们的 TCP 是与模型无关的,可灵活集成到任意视频架构中,从而形成用于有效视频识别的 TCPNet。使用多种视频架构在六个基准(如 Kinetics、Something-Something V1 和 Charades)上的大量实验表明,我们的 TCPNet 明显优于对应方法,同时具有强大的泛化能力。源代码已公开可用。
引用
@article{arxiv.2110.14381,
title = {Temporal-attentive Covariance Pooling Networks for Video Recognition},
author = {Zilin Gao and Qilong Wang and Bingbing Zhang and Qinghua Hu and Peihua Li},
journal= {arXiv preprint arXiv:2110.14381},
year = {2021}
}
备注
Accepted to NeurIPS 2021; Project page: https://github.com/ZilinGao/Temporal-attentive-Covariance-Pooling-Networks-for-Video-Recognition