视频模型中独立的帧间注意力
计算机视觉与模式识别
2022-06-15 v1 人工智能
多媒体
摘要
运动作为视频的独特性,对视频理解模型的发展一直至关重要。现代深度学习模型通过执行时空 3D 卷积、将 3D 卷积分解为空间与时间卷积,或沿时间维度计算自注意力来利用运动。此类成功背后的隐含假设是连续帧间的特征图可以被很好地聚合。然而,该假设可能并非总成立,尤其对于大形变的区域。本文中,我们提出一种新的帧间注意力块方案,即独立帧间注意力(SIFA),其新颖地探究跨帧形变以在每个空间位置估计局部自注意力。技术上,SIFA 通过以两帧间差异重新缩放偏移预测来重塑可变形设计。以当前帧中每个空间位置作为查询,下一帧中局部可变形邻域被视为键/值。然后,SIFA 度量查询与键之间的相似性作为独立注意力,对值进行加权平均以实现时间聚合。我们进一步将 SIFA 块分别插入 ConvNets 与 Vision Transformer,以设计 SIFA-Net 与 SIFA-Transformer。在四个视频数据集上的大量实验证明了 SIFA-Net 与 SIFA-Transformer 作为更强骨干网络的优越性。更显著的是,SIFA-Transformer 在 Kinetics-400 数据集上取得了 83.1% 的准确率。源代码见 https://github.com/FuchenUSTC/SIFA。
引用
@article{arxiv.2206.06931,
title = {Stand-Alone Inter-Frame Attention in Video Models},
author = {Fuchen Long and Zhaofan Qiu and Yingwei Pan and Ting Yao and Jiebo Luo and Tao Mei},
journal= {arXiv preprint arXiv:2206.06931},
year = {2022}
}
备注
CVPR 2022; Code is publicly available at: https://github.com/FuchenUSTC/SIFA