基于检索增强的临床试验招募中的证据定位大语言模型
计算与语言
2026-04-30 v2 人工智能
信息检索
摘要
为患者筛选入组是众所周知且耗时的瓶颈,导致入不足而最终引发试验失败。近期大型语言模型(LLM)的突破为利用人工智能改善筛选提供了可行的机遇。本研究系统性地探索了encoder和decoder基的生成式LLM用于筛选临床叙述以促进临床试验招募。我们考察了通用型LLM和医学适配型LLM,并探讨了三种策略以缓解处理长文档时的"Lost in the Middle"问题,包括:1) 原始长上下文:使用LLM的默认上下文窗口;2) 基于NER的提取式摘要:通过命名实体识别将长文档转换为摘要;3) RAG:基于适格性标准的动态证据检索。采用2018年N2C2 Track 1基准数据集进行评估。我们的实验结果表明,MedGemma模型在RAG策略下取得微-F1分数89.05%,超越其他模型。生成式LLM在需要跨长文档进行长期推理的试验准则方面取得了显著的改进,而那些仅涉及短ontext(如实验室检测)的准则则仅显示增量性改进。在实际应用中,必须考虑特定准则来选择规则查询、encoder型LLM或生成式LLM,以在合理计算成本内最大化效率。
引用
@article{arxiv.2604.05190,
title = {Retrieval-Augmented LLMs for Evidence Localization in Clinical Trial Recruitment from Longitudinal EHR Narratives},
author = {Ziyi Chen and Mengxian Lyu and Cheng Peng and Yonghui Wu},
journal= {arXiv preprint arXiv:2604.05190},
year = {2026}
}