为视觉 Transformer 学习空间衰减
计算机视觉与模式识别
2025-12-30 v2
摘要
视觉 Transformer(ViT)已彻底改变计算机视觉领域,但其自注意力机制缺乏显式的空间归纳偏置,导致在空间结构任务上的性能次优。现有方法基于固定距离度量引入数据无关的空间衰减,应用统一的注意力加权 regardless of image content,限制了其对多样化视觉场景的适应性。受大型语言模型中内容感知门控机制(如 GLA、HGRN2、FOX)显著优于静态方法的最新进展的启发,我们首次成功地将数据依赖的空间衰减适用于2D视觉 Transformer。我们引入了空间衰减 Transformer(SDT),其特点是一种新颖的情境感知门控(CAG)机制,生成基于数据的动态衰减,用于 patch 之间的相互作用。我们的 метод学习根据内容相关性和空间距离调制空间注意力。我们解决了从1D到2D适应的根本挑战,通过一种统一的空间-内容融合框架,将曼哈顿距离的空间先验与学习的内容表示相结合。在ImageNet-1K 分类和生成任务上的大规模实验表明,我们的方法在强大的基准方法上实现了持续的改进。我们的工作确立了数据依赖的空间衰减作为增强视觉 Transformer 空间注意力的新范式。
引用
@article{arxiv.2508.09525,
title = {Learning Spatial Decay for Vision Transformers},
author = {Yuxin Mao and Zhen Qin and Jinxing Zhou and Bin Fan and Jing Zhang and Yiran Zhong and Yuchao Dai},
journal= {arXiv preprint arXiv:2508.09525},
year = {2025}
}
备注
AAAI 2026