中文

LVLMs 中基于损失排序的视觉提示检索 AutoV

计算机视觉与模式识别 2026-03-06 v3

摘要

受文本提示在大型语言模型(large language model,LLM)中的作用启发,视觉提示(visual prompts)被探索用于增强大型视觉语言模型(large vision-language model,LVM)的感知能力。然而,性能在单一视觉提示设计下往往会饱和,进而使进一步的提示工程变得日益无效。为此,我们从提示工程转向提示检索,提出 AutoV:一个轻量级的实例自适应视觉提示识别框架。给定输入图像和文本查询,AutoV 自动从多样化的候选池中定位最合适的视觉提示。训练此类检索框架需要逐级监督,但提示质量本质上模糊且难以可靠评估。为实现自动监督,我们使用预训练的 LVM 对视觉提示进行评估,并根据其预测损失对其进行标记。借助基于损失排序的稳健训练信号,AutoV 能在无需手动标注的情况下学习为每个实例检索查询感知的最优提示。实验表明,AutoV 在图像理解、描述、定位和分类等任务上提升了各类 LVM 的性能。例如,AutoV 在 VizWiz 上的 LLaVA-OV 提升了 10.2%\textbf{10.2}\%,在 MMMU 上的 Qwen2.5-VL 提升了 3.8%\textbf{3.8}\%

关键词

引用

@article{arxiv.2506.16112,
  title  = {AutoV: Loss-Oriented Ranking for Visual Prompt Retrieval in LVLMs},
  author = {Yuan Zhang and Chun-Kai Fan and Sicheng Yu and Junwen Pan and Tao Huang and Ming Lu and Kuan Cheng and Qi She and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2506.16112},
  year   = {2026}
}