中文

基于四边形注意力的视觉 Transformer

计算机视觉与模式识别 2023-03-28 v1

摘要

基于窗口的注意力因其优越性能、更低计算复杂度和更小内存占用而成为视觉 Transformer 中的热门选择。然而,这种手工设计窗口(与数据无关)限制了 Transformer 适应不同大小、形状和方向物体的灵活性。为解决此问题,我们提出一种新颖的四边形注意力(QA)方法,将基于窗口的注意力扩展为通用四边形形式。我们的方法采用端到端可学习的四边形回归模块,预测变换矩阵以将默认窗口变换为目标四边形,用于令牌采样和注意力计算,使网络能对具有不同形状和方向的各种目标建模并捕获丰富上下文信息。我们将 QA 集成到扁平与分层视觉 Transformer 中,创建名为 QFormer 的新架构,其仅需微小代码修改且带来可忽略的额外计算成本。在公开基准上的大量实验表明,QFormer 在分类、目标检测、语义分割和姿态估计等多种视觉任务上优于现有代表性视觉 Transformer。代码将在 \href{https://github.com/ViTAE-Transformer/QFormer}{QFormer} 公开。

关键词

引用

@article{arxiv.2303.15105,
  title  = {Vision Transformer with Quadrangle Attention},
  author = {Qiming Zhang and Jing Zhang and Yufei Xu and Dacheng Tao},
  journal= {arXiv preprint arXiv:2303.15105},
  year   = {2023}
}

备注

15 pages, the extension of the ECCV 2022 paper (VSA: Learning Varied-Size Window Attention in Vision Transformers)