MedHallTune:用于缓解视觉-语言模型中医学幻觉的指令微调基准
人工智能
2025-03-03 v1 计算与语言
计算机视觉与模式识别
摘要
视觉-语言模型(VLMs)在医疗保健应用中的日益广泛使用带来了与幻觉相关的巨大挑战,模型可能生成看似合理但实际上不正确的结果。此类幻觉可能危及临床决策,从而潜在地损害诊断和治疗。在本工作中,我们提出了 MedHallTune,这是一个专门设计用于评估和缓解医学 VLMs 中幻觉的大规模基准。MedHallTune 包含超过 100,000 张图像和 1,000,000 个指令对,其中包括幻觉和非幻觉样本,每个样本均带有真值标注。我们使用 MedHallTune 对当前的医学和通用 VLMs 进行了全面评估,在临床准确性、相关性、细节水平和风险水平等关键指标上评估了它们的性能。实验结果表明,使用 MedHallTune 进行微调成功提升了多个现有模型管理幻觉的能力,并提高了它们在下游视觉问答(VQA)任务上的零样本性能,使其在实际医疗应用中更加可靠。我们的工作有助于开发更值得信赖的 VLMs。代码和数据集可在 \href{https://github.com/russellyq/MedHallTune}{MedHallTune} 获取。
引用
@article{arxiv.2502.20780,
title = {MedHallTune: An Instruction-Tuning Benchmark for Mitigating Medical Hallucination in Vision-Language Models},
author = {Qiao Yan and Yuchen Yuan and Xiaowei Hu and Yihan Wang and Jiaqi Xu and Jinpeng Li and Chi-Wing Fu and Pheng-Ann Heng},
journal= {arXiv preprint arXiv:2502.20780},
year = {2025}
}