CLIP-UP:基于CLIP的视觉问答无解问题检测
计算机视觉与模式识别
2025-12-09 v2
摘要
视觉语言模型(Vision-Language Models, VLMs)在视觉理解和推理方面展现出惊人的能力,例如在视觉问答(Visual Question Answering, VQA)中,该模型被要求就与视觉输入相关的提问作答。然而,这些模型会产生明显不自然的错误,例如对无法回答的VQA问题提供(错误的)答案,例如询问图像中不存在的对象的问题。为此,我们提出了CLIP-UP:CLIP-based Unanswerable Problem detection,即CLIP-based无解问题检测,一种新颖的轻量级方法,为VLMs提供拒绝回答无法回答问题的能力。CLIP-UP利用CLIP基于相似度的度量,从而提取问题-图像对齐信息,以检测问题的不可解性,该方法仅需训练少量额外层,同时保持原始VLMs的权重不变。在多个模型上测试后,CLIP-UP在评估VQA中不可解性的多个基准上实现了显著提升,超越了其他方法,同时保持了在其他任务上的原始性能。
引用
@article{arxiv.2501.01371,
title = {CLIP-UP: CLIP-Based Unanswerable Problem Detection for Visual Question Answering},
author = {Ben Vardi and Oron Nir and Ariel Shamir},
journal= {arXiv preprint arXiv:2501.01371},
year = {2025}
}
备注
Revised version. Improvements include support for open-ended VQA and an alternative injection method