大型语言模型能否匹配系统评价的结论?
计算与语言
2025-05-30 v1
摘要
系统评价(Systematic Review, SR)中,专家汇总并分析各项独立研究的证据,以提供关于特定主题的见解,是循证临床决策、研究和政策的基石。鉴于科学文章的指数级增长,人们越来越关注使用大型语言模型(LLM)来自动化生成 SR。然而,LLM 在批判性评估证据、跨多文档推理以提供与领域专家同等水平建议方面的能力,目前仍不甚明了。因此我们提出:当获得相同的研究文献时,LLM 能否匹配临床专家撰写的系统评价结论?为探讨这一问题,我们提出了 MedEvidence,一个将 100 项 SR 的发现与其所基于的研究相配对的基准。我们在 MedEvidence 上对 24 个 LLM 进行了基准测试,涵盖推理模型、非推理模型、医疗专用模型以及不同规模(从 7B 到 700B)的模型。通过系统性评估,我们发现推理能力并不必然提升性能,更大的模型并不总能带来更大收益,且基于知识的微调会降低在 MedEvidence 上的准确性。相反,大多数模型表现出相似的行为:随着 token 长度增加性能趋于下降,其响应表现出过度自信,且与人类专家相反,所有模型对低质量发现缺乏科学怀疑态度。这些结果表明,尽管这些系统已被部署并供临床医生使用,但在 LLM 能够可靠匹配专家进行的 SR 观察结果之前,仍需开展更多工作。我们向更广泛的研究社区发布了代码库和基准,以进一步研究基于 LLM 的 SR 系统。
引用
@article{arxiv.2505.22787,
title = {Can Large Language Models Match the Conclusions of Systematic Reviews?},
author = {Christopher Polzak and Alejandro Lozano and Min Woo Sun and James Burgess and Yuhui Zhang and Kevin Wu and Serena Yeung-Levy},
journal= {arXiv preprint arXiv:2505.22787},
year = {2025}
}