中文

FactEHR:一个使用LLM评估临床记录事实性的数据集

计算与语言 2025-12-23 v2

摘要

验证和归属事实性声明对于大型语言模型(LLM)在医疗保健中的安全有效使用至关重要。事实性评估的核心组件是事实分解,即将复杂的临床陈述分解为细粒度的原子事实以供验证的过程。最近的工作提出了事实分解,即使用 LLM 将源文本重写为传达单一信息的简洁句子,以促进细粒度的事实验证。然而,由于密集的术语和多样的记录类型,临床文档对事实分解提出了独特的挑战,并且仍然研究不足。为了填补这一空白并探索这些挑战,我们提出了 FactEHR,这是一个自然语言推理(NLI)数据集,包含来自三个医院系统四种类型的 2,168 份临床记录的文档事实分解,产生了 987,266 个蕴含对。我们从不同维度评估生成的事实,从 LLM 的蕴含评估到定性分析。我们的评估(包括临床医生的审查)揭示了 LLM 在事实分解方面的性能存在显著差异。例如,Gemini-1.5-Flash 始终生成相关且准确的事实,而 Llama-3 8B 产生的输出较少且一致性较低。结果强调需要更好的 LLM 能力来支持临床文本中的事实验证。

关键词

引用

@article{arxiv.2412.12422,
  title  = {FactEHR: A Dataset for Evaluating Factuality in Clinical Notes Using LLMs},
  author = {Monica Munnangi and Akshay Swaminathan and Jason Alan Fries and Jenelle Jindal and Sanjana Narayanan and Ivan Lopez and Lucia Tu and Philip Chung and Jesutofunmi A. Omiye and Mehr Kashyap and Nigam Shah},
  journal= {arXiv preprint arXiv:2412.12422},
  year   = {2025}
}

备注

To appear at MLHC 2025