语义感知局部-全局视觉 Transformer
计算机视觉与模式识别
2022-11-29 v1
摘要
视觉 Transformer 已取得显著进展,其中 Swin Transformer 展示了 Transformer 在视觉任务上的巨大潜力。它通过在不重叠平移窗口内执行局部自注意力,克服了高计算复杂度的关键挑战。本文提出语义感知局部-全局视觉 Transformer(Semantic-Aware Local-Global Vision Transformer, SALG),以进一步探索相对于 Swin Transformer 的两个潜在改进。首先,与 Swin Transformer 均匀划分以生成等尺寸规则窗口进行局部自注意力不同,我们的 SALG 以无监督方式执行语义分割,以挖掘图像中潜在的语义先验。因此,每个分割区域可对应图像中语义有意义的部分,从而可能在各分割区域内得到更有效的特征。其次,不同于 Swin Transformer 仅在局部窗口内执行局部自注意力,所提 SALG 同时执行 1)局部区域内自注意力以学习各区域内的细粒度特征,以及 2)全局区域间特征传播以建模所有区域间的全局依赖。因而,我们的模型在为各 token 学习特征时能够获得全局视野,这正是 Transformer 的本质优势。得益于对语义先验的显式建模与所提局部-全局建模机制,我们的 SALG 在其他模型因建模容量不足而无法隐式学习语义的小规模模型场景下尤为有利。跨多种视觉任务的广泛实验证明了我们的模型优于其他视觉 Transformer,尤其在小规模建模场景中。
引用
@article{arxiv.2211.14705,
title = {Semantic-Aware Local-Global Vision Transformer},
author = {Jiatong Zhang and Zengwei Yao and Fanglin Chen and Guangming Lu and Wenjie Pei},
journal= {arXiv preprint arXiv:2211.14705},
year = {2022}
}