TAM:用于视频识别的时间自适应模块
计算机视觉与模式识别
2021-08-19 v3
摘要
由于相机运动、速度变化和不同活动等多种因素,视频数据具有复杂的时间动态。为有效捕获这种多样的运动模式,本文提出一种新的时间自适应模块({\bf TAM}),基于视频自身的特征图生成视频特定的时间核。TAM 通过将动态核解耦为位置敏感的重要性图和位置不变的聚合权重,提出了一种独特的两级自适应建模方案。重要性图在局部时间窗口中学习以捕获短期信息,而聚合权重从关注长期结构的全局视角生成。TAM 是一个模块化模块,可集成到 2D CNN 中,以极小的额外计算代价产生强大的视频架构(TANet)。在 Kinetics-400 和 Something-Something 数据集上的大量实验表明,我们的 TAM 持续优于其他时间建模方法,并在相似复杂度下达到最先进的性能。代码可在 \url{ https://github.com/liu-zhy/temporal-adaptive-module} 获取。
引用
@article{arxiv.2005.06803,
title = {TAM: Temporal Adaptive Module for Video Recognition},
author = {Zhaoyang Liu and Limin Wang and Wayne Wu and Chen Qian and Tong Lu},
journal= {arXiv preprint arXiv:2005.06803},
year = {2021}
}
备注
ICCV 2021 camera-ready version. Code is available at https://github.com/liu-zhy/temporal-adaptive-module