大语言模型代理能否生成真实世界证据?对医学数据库中观察性研究的评估
人工智能
2026-03-25 v1 计算与语言
摘要
观察性研究可按规模产生临床可操作证据,但在真实世界数据库中执行过程开放性强,需在队列构建、分析和报告等环节做出连贯决策。此前对大语言模型代理的评估强调单一步骤或单一答案,缺乏对结果证据捆绑完整性和内部结构的考察。为填补这一空白,我们引入 RWE-bench,这一基于 MIMIC-IV 且源自同行评议观察性研究的基准测试。每个任务提供相应的研究方案作为参考标准,要求代理在真实数据库中执行实验并迭代生成树状证据捆绑。我们评估了六个大语言模型(三款开源、三款闭源)在三种代理框架下的表现,采用 question-level 正确性和端到端任务指标。对于 162 个任务而言,成功率偏低:最佳代理达39.9%,最佳开源模型达30.4%。代理框架也对性能指标影响显著,导致超过30%的差异。此外,我们实现了一种自动化队列评估方法,以快速定位错误并识别代理的失效模式。总体而言,结果凸显了代理生成端到端证据捆绑能力的持久局限,高效验证仍是未来工作的重要方向。代码和数据已在 https://github.com/somewordstoolate/RWE-bench 提供。
引用
@article{arxiv.2603.22767,
title = {Can LLM Agents Generate Real-World Evidence? Evaluating Observational Studies in Medical Databases},
author = {Dubai Li and Yuxiang He and Yan Hu and Yu Tian and Jingsong Li},
journal= {arXiv preprint arXiv:2603.22767},
year = {2026}
}