面向大型视觉-语言模型的图像注意力提示
计算机视觉与模式识别
2024-09-26 v1 人工智能
摘要
与大型语言模型(LLM)相比,大型视觉-语言模型(LVLM)还可以接受图像作为输入,因此展现出更多有趣的新兴能力,并在各种视觉-语言任务上表现出令人印象深刻的性能。受LLM中文本提示的启发,视觉提示已被探索用于增强LVLM感知视觉信息的能力。然而,先前的视觉提示技术仅处理视觉输入而不考虑文本查询,限制了模型遵循文本指令完成任务的能力。为了填补这一空白,在这项工作中,我们提出了一种新的提示技术,称为图像注意力提示,它简单地将文本查询引导的注意力热图叠加在原始输入图像上,并有效地增强LVLM在各种任务上的表现。具体来说,我们使用辅助模型(如CLIP)根据文本查询为输入图像生成注意力热图。然后,该热图简单地乘以原始图像的像素值,以获得LVLM的实际输入图像。在各种视觉-语言基准上的大量实验验证了我们技术的有效性。例如,图像注意力提示在MM-Vet和LLaVA-Wild基准上分别将LLaVA-1.5提升了3.8%和2.9%。
引用
@article{arxiv.2409.17143,
title = {Attention Prompting on Image for Large Vision-Language Models},
author = {Runpeng Yu and Weihao Yu and Xinchao Wang},
journal= {arXiv preprint arXiv:2409.17143},
year = {2024}
}
备注
Website, see https://yu-rp.github.io/api-prompting