为视觉 Transformer 学习相关结构
计算机视觉与模式识别
2024-04-08 v1
摘要
我们提出了一种新的注意力机制,称为结构自注意力(StructSA),它利用注意力中 key-query 交互中自然出现的丰富相关模式。StructSA 通过卷积识别 key-query 相关性的空间-时间结构,并据此动态地聚合 value 特征的局部上下文。这有效地利用了图像和视频中丰富的结构模式,如场景布局、物体运动和物体间关系。以 StructSA 为主要构建模块,我们开发了结构视觉转换器(StructViT),并在 ImageNet-1K、Kinetics-400、Something-Something V1 & V2、Diving-48 和 FineGym 上实现了 state-of-the-art 结果。
引用
@article{arxiv.2404.03924,
title = {Learning Correlation Structures for Vision Transformers},
author = {Manjin Kim and Paul Hongsuck Seo and Cordelia Schmid and Minsu Cho},
journal= {arXiv preprint arXiv:2404.03924},
year = {2024}
}
备注
Accepted to CVPR 2024