中文

重新审视视觉Transformer中的[CLS]与图像块令牌交互

计算机视觉与模式识别 2026-02-10 v1

摘要

视觉Transformer已成为强大、可扩展且多功能的表示学习器。为了捕捉全局和局部特征,一个可学习的[CLS]类令牌通常被前置到图像块令牌的输入序列中。尽管性质不同,两种令牌类型在整个模型中以相同方式处理。在这项工作中,我们通过分析类令牌和图像块令牌之间的交互,研究了在不同预训练策略下全局和局部特征学习之间的摩擦。我们的分析表明,标准归一化层引入了这些令牌类型之间的隐式区分。基于这一见解,我们提出了专门的路径处理,选择性地解耦类令牌和图像块令牌的计算流,特别是在归一化层和早期的查询-键-值投影中。这种有针对性的专门化显著提高了密集预测任务的图像块表示质量。我们的实验表明,在标准基准测试上,分割性能提升了超过2个mIoU点,同时保持了强大的分类精度。所提出的修改仅增加了8%的参数,且没有额外的计算开销。通过全面的消融实验,我们深入了解了哪些架构组件从专门化中受益最多,以及我们的方法如何跨模型尺度和学习框架进行泛化。

关键词

引用

@article{arxiv.2602.08626,
  title  = {Revisiting [CLS] and Patch Token Interaction in Vision Transformers},
  author = {Alexis Marouani and Oriane Siméoni and Hervé Jégou and Piotr Bojanowski and Huy V. Vo},
  journal= {arXiv preprint arXiv:2602.08626},
  year   = {2026}
}

备注

To be published as a conference paper at ICLR 2026