中文

GTA:用于视频动作理解的全局时间注意力

计算机视觉与模式识别 2022-03-30 v3

摘要

自注意力通过学习成对交互来建模长程依赖,为视频动作识别带来了巨大提升。本文中,我们力求更深入地理解自注意力在视频时间建模中的作用。我们首先证明,通过展平所有像素对时空信息进行纠缠建模是次优的,无法显式捕捉帧间时间关系。为此,我们引入全局时间注意力(GTA),以解耦方式在空间注意力之上执行全局时间注意力。我们将GTA应用于像素及语义相似区域,以在不同空间粒度级别捕捉时间关系。与计算实例特定注意力矩阵的传统自注意力不同,GTA直接学习一个全局注意力矩阵,旨在编码可跨不同样本泛化的时间结构。我们进一步以跨通道多头方式增强GTA,以利用通道交互实现更好的时间建模。在2D和3D网络上的大量实验表明,我们的方法持续增强时间建模,并在三个视频动作识别数据集上提供最先进的性能。

关键词

引用

@article{arxiv.2012.08510,
  title  = {GTA: Global Temporal Attention for Video Action Understanding},
  author = {Bo He and Xitong Yang and Zuxuan Wu and Hao Chen and Ser-Nam Lim and Abhinav Shrivastava},
  journal= {arXiv preprint arXiv:2012.08510},
  year   = {2022}
}

备注

Accepted to BMVC 2021