中文

CLIP-UP:基于CLIP的视觉问答无解问题检测

计算机视觉与模式识别 2025-12-09 v2

摘要

视觉语言模型(Vision-Language Models, VLMs)在视觉理解和推理方面展现出惊人的能力,例如在视觉问答(Visual Question Answering, VQA)中,该模型被要求就与视觉输入相关的提问作答。然而,这些模型会产生明显不自然的错误,例如对无法回答的VQA问题提供(错误的)答案,例如询问图像中不存在的对象的问题。为此,我们提出了CLIP-UP:CLIP-based Unanswerable Problem detection,即CLIP-based无解问题检测,一种新颖的轻量级方法,为VLMs提供拒绝回答无法回答问题的能力。CLIP-UP利用CLIP基于相似度的度量,从而提取问题-图像对齐信息,以检测问题的不可解性,该方法仅需训练少量额外层,同时保持原始VLMs的权重不变。在多个模型上测试后,CLIP-UP在评估VQA中不可解性的多个基准上实现了显著提升,超越了其他方法,同时保持了在其他任务上的原始性能。

关键词

引用

@article{arxiv.2501.01371,
  title  = {CLIP-UP: CLIP-Based Unanswerable Problem Detection for Visual Question Answering},
  author = {Ben Vardi and Oron Nir and Ariel Shamir},
  journal= {arXiv preprint arXiv:2501.01371},
  year   = {2025}
}

备注

Revised version. Improvements include support for open-ended VQA and an alternative injection method