中文

MedFactEval 与 MedAgentBrief:用于生成与评估事实临床摘要的框架与工作流程

计算与语言 2025-09-09 v1

摘要

评估大型语言模型 (LLM) 生成的临床文本的事实准确性是阻碍其采纳的关键瓶颈,因为专家评审在持续质量保证方面不可扩展。我们提出两种互补的解决方案。首先,我们引入 MedFactEval—a 个可扩展且以事实为导向的评估框架,其中临床医生定义关键事实,而“LLM Jury”——多 LLM 多数投票——评估这些事实在生成摘要中的包含情况。其次,我们提出 MedAgentBrief—a 个模型无关的、多步骤工作流程,用于生成高质量、事实准确的出院摘要。为验证我们的评估框架,我们采用七位医生的多数投票建立了黄金标准,基于入院病例中由临床医生定义的关键事实。MedFactEval LLM Jury 与该委员会几乎完美地一致(Cohen's kappa=81%),其表现在统计上与单位人类专家相当(kappa=67%,P < 0.001)。我们的工作提供了稳健的评估框架 (MedFactEval) 和高绩效的生成工作流程 (MedAgentBrief),为推动生成式 AI 在临床工作流程中的负责任部署提供了全面的方法。

关键词

引用

@article{arxiv.2509.05878,
  title  = {MedFactEval and MedAgentBrief: A Framework and Workflow for Generating and Evaluating Factual Clinical Summaries},
  author = {François Grolleau and Emily Alsentzer and Timothy Keyes and Philip Chung and Akshay Swaminathan and Asad Aali and Jason Hom and Tridu Huynh and Thomas Lew and April S. Liang and Weihan Chu and Natasha Z. Steele and Christina F. Lin and Jingkun Yang and Kameron C. Black and Stephen P. Ma and Fateme N. Haredasht and Nigam H. Shah and Kevin Schulman and Jonathan H. Chen},
  journal= {arXiv preprint arXiv:2509.05878},
  year   = {2025}
}