MedHallBench:评估医学大语言模型 hallucination(幻觉)的新基准
计算与语言
2025-04-01 v4 人工智能
摘要
医学大语言模型(MLLMs)在医疗应用中展现出巨大的潜力,但其倾向于生成医学上不合理或不准确的信息——即 hallucination(幻觉)——对患者护理构成重大风险。本文引入 MedHallBench,一个用于评估和缓解 MLLMs 中 hallucination 的综合性基准框架。我们的 метод学将专家验证的医学案例情景与既定医学数据库相结合,创建健壮的评估数据集。该框架采用一种精妙的测量系统,将自动化的 ACHMI(Medical Imaging 中自动标题幻觉测量)评分与严格的临床专家评估相结合,并利用强化学习方法实现自动标注。通过为医学应用专门设计的优化强化学习从人类反馈(RLHF)训练管道,MedHallBench 在保持严格准确性标准的同时, enables 对 MLLMs 在多样临床情境下进行全面评估。我们进行了涉及多种模型的比较实验,利用该基准确立了广泛采用的大语言模型(LLM)的基线。我们的发现表明,ACHMI 能更细致地理解幻觉的影响,相较于传统指标,凸显了其在幻觉评估中的优势。这项研究建立了提高 MLLMs 在医疗环境中可靠性的基础框架,并提出了针对医疗应用中 AI 幻觉这一关键挑战的可操作策略。
引用
@article{arxiv.2412.18947,
title = {MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models},
author = {Kaiwen Zuo and Yirui Jiang},
journal= {arXiv preprint arXiv:2412.18947},
year = {2025}
}
备注
Published to AAAI-25 Bridge Program