CLIP对红圈知道什么?面向视觉语言模型的视觉提示工程
计算机视觉与模式识别
2023-08-21 v2
摘要
大规模视觉-语言模型,如CLIP,学习了强大的图像-文本表示,已应用于从零样本分类到文本到图像生成等众多任务。尽管如此,它们通过提示解决新颖判别任务的能力落后于诸如GPT-3等大型语言模型。在此我们探索视觉提示工程的想法,通过在图像空间而非文本中进行编辑来解决分类之外的计算机视觉任务。特别地,我们发现CLIP的一种涌现能力:仅通过在物体周围画一个红圈,我们即可将模型注意力引导至该区域,同时保持全局信息。我们展示了这一简单方法的威力,在零样本指代表达理解中达到最先进性能,并在关键点定位任务中取得强劲表现。最后,我们提请注意大型语言-视觉模型的一些潜在伦理担忧。
引用
@article{arxiv.2304.06712,
title = {What does CLIP know about a red circle? Visual prompt engineering for VLMs},
author = {Aleksandar Shtedritski and Christian Rupprecht and Andrea Vedaldi},
journal= {arXiv preprint arXiv:2304.06712},
year = {2023}
}
备注
ICCV 2023 Oral