中文

医学教科书中的语言模型幻觉量化

计算与语言 2026-05-08 v2 人工智能

摘要

幻觉(Hallucinations)——即大语言模型提供事实不正确且缺乏支持的回应的倾向——是自然语言处理领域的一个严重问题,我们尚未找到有效的解决方案来缓解这一问题。现有医学问答基准很少针对固定证据来源来评估这一行为。我们探讨了幻觉在教科书 grounding 的问答中发生的频率,以及不同模型在医学问答提示下的回应差异。我们进行了两项实验:第一项实验旨在确定一个突出的开源大语言模型(LLaMA-70B-Instruct)在医学问答中发生幻觉的频率,给定闭源零样本提示;第二项实验旨在确定幻觉发生频率以及临床医生对模型回应的偏好。我们在实验一中观察到,在提供段落的情况下,LLaMA-70B-Instruct 在 19.7% 的回答中出现幻觉(95% 置信区间 18.6% 到 20.7%),尽管 98.8% 的提示回应获得了最大的可信度;在实验二中,我们发现,较低的幻觉率与更高的有用性评分呈现负相关(ρ = -0.71,p = 0.058)。临床医生在两项实验中的高一致性(二次加权 κ = 0.92)以及(τ_b = 0.06 到 0.18,κ = 0.57 到 0.61)均表明了模型间的差异。我们的发现表明,在所测试的所有规模和架构中,当前的大语言模型仍不适合在无人监督的情况下部署临床应用,人类专家的监督是必要的且是主要的成本驱动因素。

关键词

引用

@article{arxiv.2603.09986,
  title  = {Quantifying Hallucinations in Language Language Models on Medical Textbooks},
  author = {Brandon C. Colelough and Davis Bartels and Dina Demner-Fushman},
  journal= {arXiv preprint arXiv:2603.09986},
  year   = {2026}
}

备注

8 pages, 4 figures