中文

利用离散语义熵过滤放射科视觉语言模型中的幻觉

计算机视觉与模式识别 2026-02-26 v2

摘要

为确定使用离散语义熵(DSE)拒绝可能产生幻觉的问题能否提高黑盒视觉语言模型(VLMs)在放射科影像视觉问答(VQA)中的准确性。本回顾性研究使用两个公开可用的去标识化数据集评估了 DSE:VQA-Med 2019 基准(500 张图像配临床问题和短文本答案)和一个诊断放射科数据集(206 例:60 例计算机断层扫描、60 例磁共振成像、60 例X射线摄影、26 例血管造影),并配有相应的真实诊断。GPT-4o 和 GPT-4.1(生成式预训练变换器;OpenAI)在温度 1.0 下回答每个问题 15 次。基线准确率通过低温答案(温度 0.1)确定。使用双向蕴含检查对意义等价的回答进行分组,并从所得语义簇的相对频率计算 DSE。在排除 DSE > 0.6 或 > 0.3 的问题后重新计算准确率。使用自助法重采样和 Bonferroni 校正阈值 p < .004 获得 p 值和 95% 置信区间。在 706 个图像-问题对中,基线准确率为 GPT-4o 的 51.7% 和 GPT-4.1 的 54.8%。在过滤高熵问题(DSE > 0.3)后,剩余问题的准确率为 GPT-4o 的 76.3%(保留问题:334/706)和 GPT-4.1 的 63.8%(保留问题:499/706)(两者 p < .001)。准确率提升在两个数据集上均有观察,并且在 Bonferroni 校正后大多保持统计显著性。DSE 通过量化语义不一致性实现了对黑盒 VLMs 中幻觉的可靠检测。该方法显著提高了诊断答案准确性,并为临床 VLM 应用提供了一种过滤策略。

关键词

引用

@article{arxiv.2510.09256,
  title  = {Hallucination Filtering in Radiology Vision-Language Models Using Discrete Semantic Entropy},
  author = {Patrick Wienholt and Sophie Caselitz and Robert Siepmann and Philipp Bruners and Keno Bressem and Christiane Kuhl and Jakob Nikolas Kather and Sven Nebelung and Daniel Truhn},
  journal= {arXiv preprint arXiv:2510.09256},
  year   = {2026}
}

备注

Code is available: https://github.com/TruhnLab/VisionSemanticEntropy