中文

视觉 Transformer 中用于局部-全局交互的轴向扩展窗口

计算机视觉与模式识别 2022-11-15 v2

摘要

近来,Transformer 在各种视觉任务中展现出有前景的性能。Transformer 设计中的一个挑战性问题是全局自注意力计算代价非常高,尤其对于高分辨率视觉任务。局部自注意力在局部区域内执行注意力计算以提升效率,这导致其单层注意力中的感受野不够大,造成上下文建模不足。当观察场景时,人类通常聚焦于局部区域,同时以粗粒度关注非注意区域。基于该观察,我们开发了轴向扩展窗口自注意力机制,在局部窗口内执行细粒度自注意力,并在水平与垂直轴上执行粗粒度自注意力,从而能有效捕获短程与长程视觉依赖。

关键词

引用

@article{arxiv.2209.08726,
  title  = {Axially Expanded Windows for Local-Global Interaction in Vision Transformers},
  author = {Zhemin Zhang and Xun Gong},
  journal= {arXiv preprint arXiv:2209.08726},
  year   = {2022}
}