医学文本中的幻觉现象与关键信息提取:开源大型语言模型的全面评估
计算与语言
2025-08-21 v3 人工智能
人机交互
摘要
临床摘要在医疗保健中至关重要,因为它将复杂的医疗数据浓缩为可理解的信息,从而增强患者理解和护理管理。大型语言模型 (LLM) 因其先进的自然语言理解能力,在自动化和提高此类摘要准确性方面展现出巨大潜力。这些模型特别适用于摘要医学/临床文本,因为精确和简洁的信息传递在该领域至关重要。本文我们探讨了开源 LLM 在从出院报告中提取关键事件(包括入院原因、主要住院事件和关键后续行动)方面的效果。此外,我们还评估了这些模型生成摘要中各种类型幻觉的发生率。检测幻觉至关重要,因为它直接影响信息的可靠性,可能影响患者护理和治疗结果。我们进行了全面的仿真,以严格评估这些模型的性能,进一步探讨提取内容在临床摘要中的准确性和忠实度。我们的结果表明,尽管 LLM(如 Qwen2.5 和 DeepSeek-v2)在捕获入院原因和住院事件方面表现相当出色,但在识别后续建议时则 generally 不够一致,这凸显了在进行综合性摘要时利用 LLM面临的更广泛挑战。
引用
@article{arxiv.2504.19061,
title = {Hallucinations and Key Information Extraction in Medical Texts: A Comprehensive Assessment of Open-Source Large Language Models},
author = {Anindya Bijoy Das and Shibbir Ahmed and Shahnewaz Karim Sakib},
journal= {arXiv preprint arXiv:2504.19061},
year = {2025}
}