带稀疏扫描先验的Vision Transformer
计算机视觉与模式识别
2025-09-11 v2
摘要
近年来,Transformer在计算机视觉任务中取得了显著进展。然而,其全局建模常伴随巨大的计算开销,与人类眼睛高效信息处理的方式截然不同。灵感来自人类眼睛的稀疏扫描机制,我们提出了一种\textbf{S}parse \textbf{S}can \textbf{S}elf-\textbf{A}ttention机制()。该机制为每个token预定义一系列感兴趣锚点(Anchors of Interest),并采用局部注意力高效地建模这些锚点周围的空间信息,避免冗余的全局建模和对局部信息的过度关注。该方法模拟了人类眼睛的功能,显著降低了视觉模型的计算负担。基于,我们引入了\textbf{S}parse \textbf{S}can \textbf{Vi}sion \textbf{T}ransformer(SSViT)。广泛的实验表明,SSViT在各种任务上表现出色。具体而言,在ImageNet分类上,SSViT在无需额外监督或训练数据的情况下,分别实现了\textbf{84.4\%/85.7\%}的top-1准确率,\textbf{4.4G/18.2G} FLOPs。SSViT在目标检测、实例分割和语义分割等下游任务中也表现出色。其在多样化数据集上的鲁棒性也得到了验证。
引用
@article{arxiv.2405.13335,
title = {Vision Transformer with Sparse Scan Prior},
author = {Yuguang Zhang and Qihang Fan and Huaibo Huang},
journal= {arXiv preprint arXiv:2405.13335},
year = {2025}
}