中文

大语言模型驱动的系统综述:我们已经达到了吗?

计算与语言 2025-05-13 v1 信息检索

摘要

系统综述(SR)是证据基础指南的关键,但往往受限于文献筛选耗时的本质。我们提出并评估了一个基于大语言模型(LLM)的内部系统,用于自动化标题/摘要和全文筛选,解决了该领域的关键空白。该系统在完成的一项关于维生素 D 和跌倒的系统综述中发挥作用(14,439 篇文章),LLM-based 系统针对标题/摘要筛选采用提示工程,针对全文筛选采用检索增强生成(RAG)。该系统实现了 99.5% 的文章排除率(AER),特异性为 99.6%,误报率(FNR)为 0%,负预测值(NPV)为 100%。筛选后,仅需人工审核 78 篇文章,包括传统方法识别的所有 20 篇文章,将人工筛选时间缩短 95.5%。与此相比,商业工具 Rayyan 在标题/摘要筛选中实现 72.1% 的 AER 和 5% 的 FNR(包括 Rayyan 认为是不确定或可能包括的文章)。降低 Rayyan 的包含阈值可将 FNR 降至 0%,但会增加筛选时间。通过覆盖两个筛选阶段,LLM-based 系统显著优于 Rayyan 和传统方法,将总筛选时间缩短至 25.5 小时,同时保持高准确性。这一发现凸显了 LLM 在 SR 工作流程中的变革性潜力,为提供一种可扩展、高效且准确的解决方案,尤其是在缺乏自动化工具的全文筛选阶段。

关键词

引用

@article{arxiv.2412.15247,
  title  = {Streamlining Systematic Reviews: A Novel Application of Large Language Models},
  author = {Fouad Trad and Ryan Yammine and Jana Charafeddine and Marlene Chakhtoura and Maya Rahme and Ghada El-Hajj Fuleihan and Ali Chehab},
  journal= {arXiv preprint arXiv:2412.15247},
  year   = {2025}
}