基于时间块平移的时空自注意力建模用于动作识别
计算机视觉与模式识别
2022-07-28 v1 人工智能
机器学习
摘要
基于 Transformer 的方法近期在基于 2D 图像的视觉任务上取得重大进展。然而,对于基于 3D 视频的任务如动作识别,直接在视频数据上应用时空 Transformer 会因块数量的大幅增加以及自注意力计算的二次复杂度带来沉重计算与内存负担。如何高效且有效地建模视频数据的 3D 自注意力一直是 Transformer 的一大挑战。本文提出一种时间块平移(TPS)方法,用于视频动作识别的 Transformer 中高效的 3D 自注意力建模。TPS 在时维上以特定马赛克模式平移部分块,从而以极小的额外代价将普通空间自注意力操作转换为时空自注意力。因此,我们可用近乎与 2D 自注意力相同的计算与内存代价计算 3D 自注意力。TPS 是即插即用模块,可插入现有 2D Transformer 模型以增强时空特征学习。所提方法在 Something-something V1 & V2、Diving-48 和 Kinetics400 上取得与最优方法竞争的性能,同时在计算与内存代价上高效得多。TPS 的源代码见 https://github.com/MartinXM/TPS。
引用
@article{arxiv.2207.13259,
title = {Spatiotemporal Self-attention Modeling with Temporal Patch Shift for Action Recognition},
author = {Wangmeng Xiang and Chao Li and Biao Wang and Xihan Wei and Xian-Sheng Hua and Lei Zhang},
journal= {arXiv preprint arXiv:2207.13259},
year = {2022}
}
备注
Accepted by ECCV22