中文

MedMeta:面向大语言模型从医学研究中合成 Meta-Analysis 结论的基准

计算与语言 2026-05-12 v1 人工智能

摘要

大语言模型(LLM)已在测试事实回忆的标准医学基准上达到饱和,但其执行高阶推理(如从多个来源合成证据)的能力仍存在严重的探索不足。为填补这一空白,我们引入了 MedMeta,这是首个旨在评估 LLM 仅使用引用研究的摘要生成医学荟萃分析结论能力的基准。MedMeta 包含来自 PubMed(2018--2025)的 81 项荟萃分析,并使用两种不同的工作流对模型进行评估:带有真实摘要的检索增强生成(Golden-RAG)设置,以及依赖内部知识的纯参数化方法。我们的评估框架通过结构严谨的分析得到了验证,表明我们的 LLM-as-a-judge 协议与人类专家评分高度一致,高 Pearson's r 相关性(0.81)和显示可忽略系统偏差的 Bland-Altman 分析证明了这一点,确立了其作为可扩展评估的可靠代理。我们的发现强调了信息基础的关键重要性:跨模型比较,Golden-RAG 工作流持续且显著地优于纯参数化方法。相比之下,领域特定微调的收益微乎其微,且在提供外部材料时基本被抵消。此外,压力测试表明,所有模型无论架构如何,均无法识别并拒绝否定性证据,突显了当前 RAG 系统的关键漏洞。值得注意的是,即使在理想的 RAG 条件下,当前 LLM 也仅略高于平均水平(~2.7/5.0)。MedMeta 为证据合成提供了一个极具挑战性的新基准,并表明对于临床应用,开发稳健的 RAG 系统比单纯的模型专业化是更有前景的方向。

关键词

引用

@article{arxiv.2605.09661,
  title  = {MedMeta: A Benchmark for LLMs in Synthesizing Meta-Analysis Conclusion from Medical Studies},
  author = {Huy Hoang Ha and Benoit Favre and Francois Portet},
  journal= {arXiv preprint arXiv:2605.09661},
  year   = {2026}
}