中文

超越字面摘要:医学 SOAP 记事册评估中的 hallucination 重定义

人工智能 2026-04-17 v1

摘要

评估大型语言模型(LLM)用于临床文档任务,如 SOAP 记事册生成,仍具有挑战性。不同于标准摘要,这类任务要求进行临床抽象、归一化口语语言以及医学依据的推理。然而,现行评估方法,包括自动化指标和 LLM 作为评判框架,依赖字面忠诚度,常将任何未显式出现于录音笔录中的信息标记为 hallucination。我们展示,这类方法会系统性地将临床上有效的输出误分类为错误,夸大了 hallucination 率并扭曲了模型评估。我们的分析揭示,许多被标记的 hallucination 对应的是合法的临床转换,包括同义映射、检查发现的抽象化、诊断推理以及符合指南的护理计划。通过与临床推理一致的评估标准,通过校准的提示和基于医学本体论的检索,我们观察到结果发生了显著变化。在字面评估框架下,平均 hallucination 率为35%,严重惩罚有效推理;在具感知推理的评估下,这一率下降至9%,剩余案例反映真正的安全顾虑。这一发现表明,当前的评估实践可能过度惩罚有效的临床推理,可能测度的是评估设计的副作用而非真正的错误,强调在医学等高情境领域需要以临床为导向的评估。

关键词

引用

@article{arxiv.2604.14829,
  title  = {Beyond Literal Summarization: Redefining Hallucination for Medical SOAP Note Evaluation},
  author = {Bhavik Vachhani and Kush Shrisvastava and Pranshu Nema and Sai Chiranthan},
  journal= {arXiv preprint arXiv:2604.14829},
  year   = {2026}
}

备注

12 pages, 2 figures,3 tables