V-Loop:用于医学视觉问答幻觉检测的视觉逻辑环验证
计算机视觉与模式识别
2026-01-27 v1
摘要
多模态大语言模型(MLLMs)在医学视觉问答(VQA)中辅助疾病诊断方面展现出了卓越的能力。然而,其输出仍然容易产生幻觉(即与视觉事实相矛盾的回答),在高风险医疗场景中构成重大隐患。近期的内省检测方法,特别是基于不确定性的方法,提供了计算效率,但本质上是间接的,因为它们估计的是图像-问题对的预测不确定性,而非验证特定答案的事实正确性。为解决这一局限性,我们提出了视觉逻辑环验证(V-Loop),一种用于医学 VQA 幻觉检测的免训练即插即用框架。V-Loop 引入了一个双向推理过程,形成视觉基础逻辑环以验证事实正确性。给定输入后,MLLM 为主输入对生成答案。V-Loop 从主问答对中提取语义单元,通过以答案单元为条件生成验证问题来重新查询问题单元,并强制执行视觉注意力一致性,以确保回答主问题和验证问题均依赖于相同的图像证据。如果验证答案与预期语义内容匹配,则逻辑环闭合,表明具有事实基础;否则,主答案被标记为幻觉。在多个医学 VQA 基准和 MLLMs 上的广泛实验表明,V-Loop 始终优于现有的内省方法,保持高度高效,并在组合使用时进一步提升了基于不确定性的方法。
引用
@article{arxiv.2601.18240,
title = {V-Loop: Visual Logical Loop Verification for Hallucination Detection in Medical Visual Question Answering},
author = {Mengyuan Jin and Zehui Liao and Yong Xia},
journal= {arXiv preprint arXiv:2601.18240},
year = {2026}
}