中文

为视觉 Transformer 学习相关结构

计算机视觉与模式识别 2024-04-08 v1

摘要

我们提出了一种新的注意力机制,称为结构自注意力(StructSA),它利用注意力中 key-query 交互中自然出现的丰富相关模式。StructSA 通过卷积识别 key-query 相关性的空间-时间结构,并据此动态地聚合 value 特征的局部上下文。这有效地利用了图像和视频中丰富的结构模式,如场景布局、物体运动和物体间关系。以 StructSA 为主要构建模块,我们开发了结构视觉转换器(StructViT),并在 ImageNet-1K、Kinetics-400、Something-Something V1 & V2、Diving-48 和 FineGym 上实现了 state-of-the-art 结果。

关键词

引用

@article{arxiv.2404.03924,
  title  = {Learning Correlation Structures for Vision Transformers},
  author = {Manjin Kim and Paul Hongsuck Seo and Cordelia Schmid and Minsu Cho},
  journal= {arXiv preprint arXiv:2404.03924},
  year   = {2024}
}

备注

Accepted to CVPR 2024