中文

MedHEval:医疗大型视觉语言模型的幻觉基准测试与缓解策略

计算机视觉与模式识别 2025-03-05 v1 人工智能

摘要

大型视觉语言模型(LVLMs)在医疗领域的重要性日益凸显,然而由于专业知识有限且医疗应用复杂,医疗大型视觉语言模型(Med-LVLMs)经常产生幻觉。现有基准测试无法根据幻觉的根本原因对其进行有效评估,且缺乏对缓解策略的评估。为了填补这一空白,我们引入了 MedHEval,这是一种新颖的基准测试,通过将幻觉及其缓解策略分为三种根本原因——视觉误解、知识缺陷和上下文错位,来系统评估 Med-LVLMs 中的幻觉与缓解策略。我们构建了包含综合评估指标的多样化开放式与封闭式医疗 VQA 数据集,以评估这些幻觉类型。我们在 11 个流行的 (Med)-LVLMs 上进行了广泛实验,并评估了 7 种 SOTA 幻觉缓解技术。结果表明,Med-LVLMs 在应对由不同原因引起的幻觉时存在困难,而现有缓解方法的效果有限,尤其是对于基于知识和上下文的错误。这些发现凸显了改进对齐训练和开发专门缓解策略以增强 Med-LVLMs 可靠性的必要性。MedHEval 建立了评估和缓解医疗幻觉的标准化框架,为开发更值得信赖的 Med-LVLMs 提供指导。

关键词

引用

@article{arxiv.2503.02157,
  title  = {MedHEval: Benchmarking Hallucinations and Mitigation Strategies in Medical Large Vision-Language Models},
  author = {Aofei Chang and Le Huang and Parminder Bhatia and Taha Kass-Hout and Fenglong Ma and Cao Xiao},
  journal= {arXiv preprint arXiv:2503.02157},
  year   = {2025}
}

备注

Preprint, under review