先定位后回答:面向可溯源医学多模态大语言模型的幻觉评估基准
计算机视觉与模式识别
2026-03-17 v5
摘要
医学大型多模态模型(LMM)在医学数据解读方面展现了卓越能力。然而,这些模型经常产生与源证据相矛盾的幻觉,尤其归因于定位推理不足。本工作揭示了当前医学 LMM 的一个关键局限:在回答疾病相关查询时,它们往往依赖语言模式或关注无关图像区域,而非分析相关病理区域。为解决此问题,我们引入了 HEAL-MedVQA(基于定位的幻觉评估医学视觉问答),一个旨在评估 LMM 定位能力和幻觉鲁棒性的综合基准。HEAL-MedVQA 具有 (i) 两种创新的评估协议,用于评估视觉和文本捷径学习,以及 (ii) 一个包含 67K 个 VQA 对的数据集,并带有医生标注的病理区域解剖分割掩码。为改善视觉推理,我们提出了先定位后回答(LobA)框架,该框架训练 LMM 定位目标感兴趣区域,并进行自我提示以强调分割出的病理区域,从而生成有依据且可靠的答案。实验结果表明,在具有挑战性的 HEAL-MedVQA 基准上,我们的方法显著优于最先进的生物医学 LMM,提升了医学 VQA 的鲁棒性。
引用
@article{arxiv.2505.00744,
title = {Localizing Before Answering: A Hallucination Evaluation Benchmark for Grounded Medical Multimodal LLMs},
author = {Dung Nguyen and Minh Khoi Ho and Huy Ta and Thanh Tam Nguyen and Qi Chen and Kumar Rav and Quy Duong Dang and Satwik Ramchandre and Son Lam Phung and Zhibin Liao and Minh-Son To and Johan Verjans and Phi Le Nguyen and Vu Minh Hieu Phan},
journal= {arXiv preprint arXiv:2505.00744},
year = {2026}
}
备注
Accepted at Joint Conference on Artificial Intelligence (IJCAI) 2025