验证幻象:映射自我验证在医学 VQA 中的可靠性边界
计算机视觉与模式识别
2026-05-12 v1
摘要
自我验证——即重新调用相同的视觉语言模型(VLM)以检验其生成答案的可靠性——日益成为医学视觉问答(VQA)中的默认安全层。我们认为这种做法本质上不可靠。我们引入 [方法名称],一种诊断框架,用于映射医学 VLM 自我验证的可靠性边界,通过分解验证器行为为判别能力和一致性偏差。由于验证器和答案生成器的容量耦合,验证器可能过度地与生成器保持一致,从而产生验证幻象:一种同时具有高验证器错误和高一致性偏差的 regime,由对错误答案的错误接受驱动。我们在六个开源 VLM 上评估了五个医学 VQA 数据集和七个医学任务,发现该边界强烈依赖于具体任务。知识密集型临床任务深陷幻象之中,较简单的任务更抗压,感知任务居中。验证也未能提供独立的安全信号: logistic mixed-effects analysis 显示,验证器错误和一致性偏差在生成器错误时更可能发生;而 saliency 分析表明,验证器相对于生成器更少地关注图像证据,我们称之为懒惰验证器。跨验证虽能减少幻象,但并未消除。此外,当验证在多轮 actor-verifier 循环中重复使用时,大多数最初错误的答案会被错误的验证所锁定。由于我们的实验使用的是干净的基准数据集,观察到的可靠性边界可能低估了在真实临床部署中的失败情况。
引用
@article{arxiv.2605.10850,
title = {Verification Mirage: Mapping the Reliability Boundary of Self-Verification in Medical VQA},
author = {Ruinan Jin and Beidi Zhao and Myeongkyun Kang and Qiong Zhang and Xiaoxiao Li},
journal= {arXiv preprint arXiv:2605.10850},
year = {2026}
}
备注
31 pages, 12 figures