中文

关系自注意力:视频理解中注意力机制缺失了什么

计算机视觉与模式识别 2021-11-03 v1

摘要

卷积可以说是现代神经网络最重要的特征变换,推动了深度学习的进步。最近出现的 Transformer 网络用自注意力模块取代卷积层,揭示了静态卷积核的局限性,开启了动态特征变换的时代。然而,现有的动态变换(包括自注意力)在视频理解方面都存在局限,因为在视频理解中,空间和时间上的对应关系(即运动信息)对于有效表示至关重要。在这项工作中,我们引入了一种关系特征变换,称为关系自注意力(RSA),它通过动态生成关系核并聚合关系上下文,利用视频中丰富的时空关系结构。我们的实验和消融研究表明,RSA 网络显著优于卷积和自注意力对应方法,在标准的以运动为中心的视频动作识别基准(如 Something-Something-V1 & V2、Diving48 和 FineGym)上达到了最先进的性能。

关键词

引用

@article{arxiv.2111.01673,
  title  = {Relational Self-Attention: What's Missing in Attention for Video Understanding},
  author = {Manjin Kim and Heeseung Kwon and Chunyu Wang and Suha Kwak and Minsu Cho},
  journal= {arXiv preprint arXiv:2111.01673},
  year   = {2021}
}

备注

Accepted to NeurIPS 2021