基于后向视觉 grounding 的 MLLMs 丰富上下文幻觉检测:让相信见证真理
计算与语言
2025-11-18 v1 计算机视觉与模式识别
摘要
多模态大语言模型(MLLMs)已解锁强大的跨模态能力,但仍显著受制于幻觉现象。因此,准确检测 MLLMs 的幻觉现象对于确保其在实际应用中的可靠性至关重要。为此,本文依据“Seeing is Believing”原则,引入 VBackChecker,一种新颖的无参考幻觉检测框架,通过利用具备推理和指 refer 分割能力的像素级 grounding LLM 来验证 MLLMs 生成响应与视觉输入的一致性。该无参考框架不仅有效处理丰富上下文场景,还提供可解释性。为此,设计了创新的指令微调数据生成管道(R-Instruct),包含丰富的上下文描述、grounding 掩码和硬负样本。我们进一步建立 R^2 -HalBench,一个新的 MLLMs 幻觉基准数据集,不同于先前基准,涵盖来自 18 个 MLLMs 的真实世界丰富上下文描述,具有高质量标注,涉及多样的对象、属性和关系层次细节。VBackChecker 在 R^2 -HalBench 上超越先前复杂框架,实现最先进性能,甚至与 GPT-4o 在幻觉检测方面持平。在像素级 grounding 任务中,它也超越了先前方法,实现超过 10% 的提升。所有代码、数据和模型均可用 https://github.com/PinxueGuo/VBackChecker 获取。
引用
@article{arxiv.2511.12140,
title = {Seeing is Believing: Rich-Context Hallucination Detection for MLLMs via Backward Visual Grounding},
author = {Pinxue Guo and Chongruo Wu and Xinyu Zhou and Lingyi Hong and Zhaoyu Chen and Jinglun Li and Kaixun Jiang and Sen-ching Samson Cheung and Wei Zhang and Wenqiang Zhang},
journal= {arXiv preprint arXiv:2511.12140},
year = {2025}
}