学习视觉提示以引导视觉Transformer的注意力
计算机视觉与模式识别
2024-06-06 v1
摘要
视觉提示将视觉信息注入输入图像,以使模型适应特定的预测和任务。最近,诸如红色圆圈之类的手工标记被证明可以引导模型关注图像上的目标区域。然而,这些标记仅适用于使用包含这些标记的数据训练的模型。此外,寻找这些提示需要猜测或了解模型训练领域的先验知识。本文通过提出学习视觉提示来引导视觉Transformer的注意力,从而规避了手动设计约束。学习到的视觉提示添加到任何输入图像后,会将预训练视觉Transformer的注意力重定向到其在图像上的空间位置。具体而言,该提示以自监督方式学习,无需标注,也无需微调视觉Transformer。我们的实验证明了所提出的基于优化的视觉提示策略在各种预训练视觉编码器上的有效性。
引用
@article{arxiv.2406.03303,
title = {Learning Visual Prompts for Guiding the Attention of Vision Transformers},
author = {Razieh Rezaei and Masoud Jalili Sabet and Jindong Gu and Daniel Rueckert and Philip Torr and Ashkan Khakzar},
journal= {arXiv preprint arXiv:2406.03303},
year = {2024}
}
备注
Short version (4-pages) accepted as a spotlight paper at T4V workshop, CVPR 2024