关系自注意力:视频理解中注意力机制缺失了什么
计算机视觉与模式识别
2021-11-03 v1
摘要
卷积可以说是现代神经网络最重要的特征变换,推动了深度学习的进步。最近出现的 Transformer 网络用自注意力模块取代卷积层,揭示了静态卷积核的局限性,开启了动态特征变换的时代。然而,现有的动态变换(包括自注意力)在视频理解方面都存在局限,因为在视频理解中,空间和时间上的对应关系(即运动信息)对于有效表示至关重要。在这项工作中,我们引入了一种关系特征变换,称为关系自注意力(RSA),它通过动态生成关系核并聚合关系上下文,利用视频中丰富的时空关系结构。我们的实验和消融研究表明,RSA 网络显著优于卷积和自注意力对应方法,在标准的以运动为中心的视频动作识别基准(如 Something-Something-V1 & V2、Diving48 和 FineGym)上达到了最先进的性能。
引用
@article{arxiv.2111.01673,
title = {Relational Self-Attention: What's Missing in Attention for Video Understanding},
author = {Manjin Kim and Heeseung Kwon and Chunyu Wang and Suha Kwak and Minsu Cho},
journal= {arXiv preprint arXiv:2111.01673},
year = {2021}
}
备注
Accepted to NeurIPS 2021