FALIP:视觉提示作为中央凹注意力提升CLIP零样本性能
计算机视觉与模式识别
2024-08-22 v2
摘要
CLIP在由配对的图像-文本数据组成的大规模数据集上进行预训练后,取得了令人印象深刻的零样本性能。先前的工作通过将手动设计的视觉提示(如彩色圆圈和模糊掩码)融入图像来利用CLIP,以引导模型的注意力,从而在下游任务中显示出增强的零样本性能。尽管这些方法取得了有希望的结果,但它们不可避免地改变了图像的原始信息,这可能导致在特定任务中失败。我们提出了一种无需训练的方法——中央凹注意力CLIP(FALIP),它通过将中央凹注意力掩码插入多头自注意力模块中来调整CLIP的注意力。我们证明了FALIP在指代表达理解、图像分类和3D点云识别等任务中有效地提升了CLIP的零样本性能。实验结果进一步表明,FALIP在大多数指标上优于现有方法,并且可以增强当前方法以提升其性能。
引用
@article{arxiv.2407.05578,
title = {FALIP: Visual Prompt as Foveal Attention Boosts CLIP Zero-Shot Performance},
author = {Jiedong Zhuang and Jiaqi Hu and Lianrui Mu and Rui Hu and Xiaoyu Liang and Jiangnan Ye and Haoji Hu},
journal= {arXiv preprint arXiv:2407.05578},
year = {2024}
}
备注
Accepted by ECCV 2024, code released