LocalViT:视觉Transformer中的局部性分析
计算机视觉与模式识别
2025-02-13 v2
摘要
本文旨在研究视觉Transformer中局部性机制的影响。Transformer起源于机器翻译,特别擅长对长序列中的长程依赖关系进行建模。尽管token嵌入之间的全局交互可以通过Transformer的自注意力机制很好地建模,但缺乏在局部区域内进行信息交换的局部性机制。本文通过精心设计的对照实验对局部性机制进行了系统研究。我们将局部性引入视觉Transformer的前馈网络中。这一看似简单的方案受到前馈网络与倒残差块之间比较的启发。局部性机制的重要性通过两种方式得到验证:1)在将局部性机制引入时,存在广泛的设计选择(激活函数、层放置、扩展比),恰当的选择可带来相对于基线的性能提升;2)相同的局部性机制被成功应用于具有不同架构设计的视觉Transformer,显示了局部性概念的泛化能力。在ImageNet2012分类任务上,局部性增强的Transformer以可忽略的参数数量和计算量增长,分别超越基线Swin-T、DeiT-T和PVT-T达1.0%、2.6%和3.1%。代码见https://github.com/ofsoundof/LocalViT。
引用
@article{arxiv.2104.05707,
title = {LocalViT: Analyzing Locality in Vision Transformers},
author = {Yawei Li and Kai Zhang and Jiezhang Cao and Radu Timofte and Michele Magno and Luca Benini and Luc Van Gool},
journal= {arXiv preprint arXiv:2104.05707},
year = {2025}
}