中文

BOAT:双边局部注意力视觉 Transformer

计算机视觉与模式识别 2022-10-20 v2 机器学习

摘要

视觉 Transformer 在许多计算机视觉任务中取得了优异性能。早期的视觉 Transformer 如 ViT 和 DeiT 采用全局自注意力,当图像块数量较大时计算代价高昂。为提高效率,近期的视觉 Transformer 采用局部自注意力机制,在局部窗口内计算自注意力。尽管基于窗口的局部自注意力显著提升了效率,却无法捕捉图像平面上遥远但相似的块之间的关系。为克服图像空间局部注意力的这一局限,本文进一步利用了块在特征空间中的局部性。我们使用块的特征将其分组为多个簇,并在每个簇内计算自注意力。这种特征空间局部注意力有效捕捉了不同局部窗口之间但仍相关的块的联系。我们提出了一种双边局部注意力视觉 Transformer(BOAT),将特征空间局部注意力与图像空间局部注意力相整合。我们进一步将 BOAT 与 Swin 和 CSWin 模型集成,在多个基准数据集上的大量实验表明,我们的 BOAT-CSWin 模型清晰且持续地优于现有的最先进 CNN 模型和视觉 Transformer。

关键词

引用

@article{arxiv.2201.13027,
  title  = {BOAT: Bilateral Local Attention Vision Transformer},
  author = {Tan Yu and Gangming Zhao and Ping Li and Yizhou Yu},
  journal= {arXiv preprint arXiv:2201.13027},
  year   = {2022}
}

备注

BMVC2022 oral