中文

EHRNoteQA:基于出院小结的临床实践LLM基准

计算与语言 2024-11-12 v5

摘要

电子健康记录(EHR)中的出院小结对临床决策至关重要,但其长度和复杂性使得信息提取颇具挑战,尤其是在处理多次入院累积的出院小结时。大语言模型(LLM)通过高效分析海量复杂数据,有望解决这一挑战。然而,现有基准在评估LLM在此场景下的能力方面存在不足,因为它们通常聚焦于单次记录信息或有限主题,未能反映临床医生所需的真实世界查询。为填补这一空白,我们引入EHRNoteQA,这是一个基于MIMIC-IV EHR构建的新型基准,包含962个不同的问答对,每个问答对与不同患者的出院小结相关联。每个问答对最初使用GPT-4生成,然后由三位临床医生手动审查和精炼,以确保临床相关性。EHRNoteQA包含需要跨多个出院小结信息的问题,涵盖八个不同主题,反映了真实临床查询的复杂性和多样性。我们以开放式和多项选择问答两种形式提供EHRNoteQA,并为每种形式提出可靠的评估方法。我们使用EHRNoteQA评估了27个LLM,并考察了影响模型性能的各种因素(例如出院小结的长度和数量)。此外,为验证EHRNoteQA作为临床实践中专家评估的可靠代理,我们测量了LLM在EHRNoteQA上的性能与临床医生手动评估的LLM性能之间的相关性。结果表明,与其他基准相比,LLM在EHRNoteQA上的性能与临床医生评估的性能具有更高的相关性(Spearman:0.78,Kendall:0.62),证明了其在临床环境中评估LLM的实际相关性。

关键词

引用

@article{arxiv.2402.16040,
  title  = {EHRNoteQA: An LLM Benchmark for Real-World Clinical Practice Using Discharge Summaries},
  author = {Sunjun Kweon and Jiyoun Kim and Heeyoung Kwak and Dongchul Cha and Hangyul Yoon and Kwanghyun Kim and Jeewon Yang and Seunghyun Won and Edward Choi},
  journal= {arXiv preprint arXiv:2402.16040},
  year   = {2024}
}

备注

NeurIPS 2024 (Datasets and Benchmarks)