视觉 Transformer 中用于局部-全局交互的轴向扩展窗口
计算机视觉与模式识别
2022-11-15 v2
摘要
近来,Transformer 在各种视觉任务中展现出有前景的性能。Transformer 设计中的一个挑战性问题是全局自注意力计算代价非常高,尤其对于高分辨率视觉任务。局部自注意力在局部区域内执行注意力计算以提升效率,这导致其单层注意力中的感受野不够大,造成上下文建模不足。当观察场景时,人类通常聚焦于局部区域,同时以粗粒度关注非注意区域。基于该观察,我们开发了轴向扩展窗口自注意力机制,在局部窗口内执行细粒度自注意力,并在水平与垂直轴上执行粗粒度自注意力,从而能有效捕获短程与长程视觉依赖。
引用
@article{arxiv.2209.08726,
title = {Axially Expanded Windows for Local-Global Interaction in Vision Transformers},
author = {Zhemin Zhang and Xun Gong},
journal= {arXiv preprint arXiv:2209.08726},
year = {2022}
}