中文

注意力中的注意力:建模上下文相关性以实现高效视频分类

计算机视觉与模式识别 2022-04-21 v1

摘要

得益于视角上下文的利用,注意力机制显著提升了视频分类神经网络的性能。然而,当前关于视频注意力的研究普遍聚焦于采用某一特定方面的上下文(例如通道、空间/时间或全局上下文)来精炼特征,并在计算注意力时忽略了它们潜在的相关性。这导致上下文利用不完整,因而存在性能提升有限的弱点。为应对该问题,本文提出一种高效的注意力中的注意力(AIA)方法用于逐元素特征精炼,其探究了将通道上下文嵌入时空注意力学习模块(称为CinST)及其反向变体(称为STinC)的可行性。具体而言,我们将视频特征上下文实例化为沿特定轴通过全局平均与最大池化操作聚合的动力学。AIA模块的工作流为:第一个注意力块使用一种上下文信息来引导第二个注意力(针对另一上下文)的门控权重计算。此外,注意力单元中的所有计算操作均作用于池化维度,这导致极少的计算成本增加(<<0.02\%)。为验证我们的方法,我们将其密集集成至两个经典视频网络骨干中,并在多个标准视频分类基准上进行了广泛实验。我们的AIA源代码可在 \url{https://github.com/haoyanbin918/Attention-in-Attention} 获取。

关键词

引用

@article{arxiv.2204.09303,
  title  = {Attention in Attention: Modeling Context Correlation for Efficient Video Classification},
  author = {Yanbin Hao and Shuo Wang and Pei Cao and Xinjian Gao and Tong Xu and Jinmeng Wu and Xiangnan He},
  journal= {arXiv preprint arXiv:2204.09303},
  year   = {2022}
}

备注

13 pages