中文

带稀疏扫描先验的Vision Transformer

计算机视觉与模式识别 2025-09-11 v2

摘要

近年来,Transformer在计算机视觉任务中取得了显著进展。然而,其全局建模常伴随巨大的计算开销,与人类眼睛高效信息处理的方式截然不同。灵感来自人类眼睛的稀疏扫描机制,我们提出了一种\textbf{S}parse \textbf{S}can \textbf{S}elf-\textbf{A}ttention机制(S3A\rm{S}^3\rm{A})。该机制为每个token预定义一系列感兴趣锚点(Anchors of Interest),并采用局部注意力高效地建模这些锚点周围的空间信息,避免冗余的全局建模和对局部信息的过度关注。该方法模拟了人类眼睛的功能,显著降低了视觉模型的计算负担。基于S3A\rm{S}^3\rm{A},我们引入了\textbf{S}parse \textbf{S}can \textbf{Vi}sion \textbf{T}ransformer(SSViT)。广泛的实验表明,SSViT在各种任务上表现出色。具体而言,在ImageNet分类上,SSViT在无需额外监督或训练数据的情况下,分别实现了\textbf{84.4\%/85.7\%}的top-1准确率,\textbf{4.4G/18.2G} FLOPs。SSViT在目标检测、实例分割和语义分割等下游任务中也表现出色。其在多样化数据集上的鲁棒性也得到了验证。

关键词

引用

@article{arxiv.2405.13335,
  title  = {Vision Transformer with Sparse Scan Prior},
  author = {Yuguang Zhang and Qihang Fan and Huaibo Huang},
  journal= {arXiv preprint arXiv:2405.13335},
  year   = {2025}
}