视觉 Transformer 需要更好的标记交互
计算机视觉与模式识别
2026-05-25 v1
摘要
视觉 Transformer (ViT) 能够在图像级别学习强大的表示,但其 patch 表示在持续训练期间变得不够有效,用于密集预测。我们重新审视了这种稀疏化现象,认为这并不完全由高范数 artifacts 所解释。相反,我们刻画了语义扩散:一种在 patch 标记之间传播全局语义信息的优化捷径,超出了局部合理范围。我们的分析表明,密集表示质量不仅仅由局部性来捕获:浅层特征可以保持更好地与前景区域对齐,但表现不佳;而 [CLS] 特征仍然对密集预测具有补充作用。这些观察表明,目标不应是消除全局上下文,而应是使标记交互更具选择性。因此,我们研究稀疏注意力作为一种最小干预,将 softmax 注意力替换为 entmax-1.5,同时保持全局标记的连接性。在 DINOv1 ViT-S/16 在 ImageNet-1K 上进行 200 个 epoch 训练的模型上,这一变化保留了 ImageNet 线性探测准确率,并在语义分割任务中显著提升性能:VOC mIoU 从 42.80 提升至 48.78,ADE20K 从 19.85 提升至 21.97,Cityscapes 从 36.79 提升至 37.87。这些结果表明,选择性标记混合是改进密集 ViT 表示的简单且有效的偏置。
引用
@article{arxiv.2605.23868,
title = {Vision Transformers Need Better Token Interaction},
author = {Linxiang Su},
journal= {arXiv preprint arXiv:2605.23868},
year = {2026}
}
备注
7 pages