中文

视觉提示需要令牌协调的提示注意力

计算机视觉与模式识别 2025-05-08 v2

摘要

视觉提示技术被广泛用于通过为所有令牌学习一小组共享提示来高效微调预训练的视觉Transformer(ViT)。然而,现有方法忽视了不同令牌在传递判别信息中的独特作用,并使用相同的提示与所有令牌交互,从而限制了ViT的表示能力。这常常导致提取的提示特征难以区分且有偏差,阻碍了性能提升。为解决此问题,我们提出了一种即插即用的令牌协调提示注意力(TCPA)模块,该模块为不同令牌分配特定的协调提示以进行基于注意力的交互。首先,认识到CLS令牌和图像令牌的不同功能——全局信息聚合和局部特征提取,我们将提示解耦为CLS提示和图像提示,它们分别通过注意力机制与CLS令牌和图像令牌进行交互。这增强了它们各自的判别能力。此外,由于不同的图像令牌对应不同的图像块并包含多样化的信息,我们采用一个匹配函数来自动为各个令牌分配协调的提示。这使得注意力交互更加精确,提高了提取特征的多样性和表示能力。在多个基准上的大量实验表明,TCPA显著增强了提取特征的多样性和判别力。代码可在https://github.com/zhoujiahuan1991/ICML2025-TCPA获取。

关键词

引用

@article{arxiv.2505.02406,
  title  = {Token Coordinated Prompt Attention is Needed for Visual Prompting},
  author = {Zichen Liu and Xu Zou and Gang Hua and Jiahuan Zhou},
  journal= {arXiv preprint arXiv:2505.02406},
  year   = {2025}
}