中文

局部关注视觉变换器

计算机视觉与模式识别 2026-03-06 v1

摘要

视觉变换器通过利用全局自注意力捕获长程依赖在分类任务中显示出卓越的成功。然而,这一机制可能遮蔽分割等任务中至关重要的细粒度空间细节。在本工作中,我们寻求在标准图像级分类训练后提升视觉变换器的分割性能。具体而言,我们提出一种简单而有效的附加方案,可在保持视觉变换器图像级识别能力的同时提高分割任务性能。在我们的方法中,我们调制自注意力机制,以可学习的高斯核为其注入偏置,使注意力倾向于邻近补丁。我们进一步细化补丁表征,以在补丁位置学习更好的嵌入。这些修改鼓励标记聚焦于局部周围环境,确保空间位置上的有意义表征,同时仍保留模型 incorporating 全局信息的能力。实验表明,我们的修改在三个基准上显著提升了分割性能(例如,在ViT Tiny和Base上分别超过6%和4%),而无需改变训练方案或牺牲分类性能。代码已公开于 https://github.com/sinahmr/LocAtViT/。

关键词

引用

@article{arxiv.2603.04892,
  title  = {Locality-Attending Vision Transformer},
  author = {Sina Hajimiri and Farzad Beizaee and Fereshteh Shakeri and Christian Desrosiers and Ismail Ben Ayed and Jose Dolz},
  journal= {arXiv preprint arXiv:2603.04892},
  year   = {2026}
}

备注

Accepted to ICLR 2026