VisionTrap:视觉数据上的不可回答问题
计算机视觉与模式识别
2025-07-24 v1
摘要
视觉问答(VQA)是广泛研究的主题,主要聚焦于如何让视觉语言模型(VLMs)针对真实世界图像作出可回答的问题。然而,针对这些模型如何处理不可回答问题的探索仍有限,尤其是在它们本应 abstain(不作答)时。本研究考察了 VQA 在不切实际生成的图像或提出不可回答问题的情形下的表现,评估模型是否识别知识局限,或尝试生成错误答案。我们引入了名为 VisionTrap 的数据集,包含三类不可回答问题,涵盖多种图像类型:(1)融合物体与动物的混合实体;(2)呈现不寻常或不可能情景中的物体;(3)虚构或不存在的图样。所提出的问题在逻辑结构上完整,却本质上不可回答,用以检验模型能否正确识别自身局限。我们的发现表明,将此类问题纳入 VQA 基准测试至关重要,以评估模型是否倾向于在本应不作答时仍尝试给出答案。
关键词
引用
@article{arxiv.2507.17262,
title = {VisionTrap: Unanswerable Questions On Visual Data},
author = {Asir Saadat and Syem Aziz and Shahriar Mahmud and Abdullah Ibne Masud Mahi and Sabbir Ahmed},
journal= {arXiv preprint arXiv:2507.17262},
year = {2025}
}