医学文本摘要中幻觉的事实受控诊断
计算与语言
2025-06-03 v1
摘要
大型语言模型(LLM)在医患对话摘要生成过程中产生的幻觉,对患者护理和临床决策构成重大风险。然而,这一现象在临床领域仍缺乏充分研究,且通用领域幻觉检测器的适用性尚不确定。幻觉的罕见性与随机性进一步增加了其研究难度。本文对医学领域的幻觉检测方法进行了评估,并为此构建了两个数据集:一个是事实受控的留一法(Leave-N-out)数据集——通过系统性地从源对话中移除事实以在摘要中诱发幻觉内容;另一个是自然幻觉数据集——在基于 LLM 的医学摘要生成过程中自然产生。我们发现,通用领域检测器难以检测临床幻觉,且在事实受控幻觉上的表现无法可靠预测其在自然幻觉上的有效性。随后,我们开发了基于事实的幻觉计数方法,提供了现有方法所不具备的可解释性。值得注意的是,我们利用事实受控幻觉开发的基于 LLM 的检测器,在检测真实世界临床幻觉时展现出良好的泛化能力。本研究提供了一套由专家标注数据集支持的专业指标,以推动构建忠实的临床摘要生成系统。
引用
@article{arxiv.2506.00448,
title = {Fact-Controlled Diagnosis of Hallucinations in Medical Text Summarization},
author = {Suhas BN and Han-Chin Shing and Lei Xu and Mitch Strong and Jon Burnsky and Jessica Ofor and Jordan R. Mason and Susan Chen and Sundararajan Srinivasan and Chaitanya Shivade and Jack Moriarty and Joseph Paul Cohen},
journal= {arXiv preprint arXiv:2506.00448},
year = {2025}
}
备注
https://github.com/amazon-science/acibench-hallucination-annotations