评估检索增强生成与长上下文输入在电子健康记录临床推理中的表现
计算与语言
2025-08-21 v1 人工智能
摘要
电子健康记录冗长、嘈杂且常含冗余信息,给必须浏览这些记录的临床医生带来了重大挑战。大语言模型为提取和推理这些非结构化文本提供了一种有前景的解决方案,但临床笔记的长度常常超出即使是最先进模型的扩展上下文窗口。检索增强生成通过从整个电子健康记录中检索与任务相关的段落,提供了一种替代方案,可能减少所需的输入令牌数量。在这项工作中,我们提出了三项旨在以最小努力在不同医疗系统间复现的临床任务:1) 提取影像学检查流程,2) 生成抗生素使用时间线,以及 3) 识别关键诊断。我们使用来自实际住院患者的电子健康记录,测试了三种最先进的大语言模型,在提供不同数量的上下文(使用目标文本检索或最近的临床笔记)下的表现。我们发现,检索增强生成的性能与使用近期笔记的性能相当或更优,并且接近使用模型完整上下文窗口的性能,同时所需的输入令牌数量大幅减少。我们的结果表明,即使新模型能够处理越来越长的文本,检索增强生成仍然是一种具有竞争力且高效的方法。
引用
@article{arxiv.2508.14817,
title = {Evaluating Retrieval-Augmented Generation vs. Long-Context Input for Clinical Reasoning over EHRs},
author = {Skatje Myers and Dmitriy Dligach and Timothy A. Miller and Samantha Barr and Yanjun Gao and Matthew Churpek and Anoop Mayampurath and Majid Afshar},
journal= {arXiv preprint arXiv:2508.14817},
year = {2025}
}