ORIC:大型视觉语言模型在上下文不一致条件下的物体识别基准测试
摘要
大型视觉语言模型(LVLMs)通过结合视觉与语言,在图像描述、视觉问答和机器人技术方面表现出色,但在非典型场景中,它们经常会遗漏明显的物体或产生不存在的物体的幻觉。我们通过不确定性的视角审视这些失败,重点关注上下文不一致性,即物体意外出现或未在预期上下文中出现的情况,并表明此类情况会增加最先进的 LVLMs 的识别难度。为了研究这一情形,我们引入了不一致上下文中的物体识别(ORIC)框架,该框架通过两种互补策略构建不一致的物体-上下文对:(1)LLM 引导的采样,以识别图像中存在的难以识别的物体;(2)CLIP 引导的采样,以挖掘合理但不存在的物体。将该方法应用于 MSCOCO,ORIC 创建了 ORIC-Bench 和 ORIC 风格的训练数据。对 18 个 LVLMs 和 2 个开放词汇检测器的评估揭示了在上下文不一致条件下的显著性能退化和偏差。在 600 个 ORIC 样本上对 Qwen3-VL-8B-Instruct 进行视觉强化微调,提升了其在 ORIC-Bench、AMBER 和 HallusionBench 上的性能。总体而言,我们表明上下文不一致性是不确定性的关键来源,并为构建更可靠的 LVLMs 提供了工具。数据集和代码已在 https://github.com/ZhaoyangLi-1/ORIC 公开。
引用
@article{arxiv.2509.15695,
title = {ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models},
author = {Zhaoyang Li and Zhan Ling and Yuchen Zhou and Litian Gong and Erdem Bıyık and Hao Su},
journal= {arXiv preprint arXiv:2509.15695},
year = {2026}
}
备注
We request withdrawal of this paper because one of the listed institutional affiliations was included without proper authorization. This issue cannot be resolved through a simple revision, and we therefore request withdrawal to prevent dissemination of incorrect or unauthorized affiliation information