大语言模型简化自动化系统综述:一项初步研究
信息检索
2025-02-25 v1 人工智能
计算与语言
摘要
大语言模型 (LLM) 在自然语言处理任务中展现出自动化系统综述的潜力。本研究评估了三种最先进的 LLM 在开展系统综述任务中的性能。我们对 GPT-4、Claude-3 和 Mistral 8x7B 进行了评估,涵盖四个系统综述任务:研究设计表述、检索策略开发、文献筛选和数据提取。数据来源于既有的系统综述,包括标准 PICO (Population, Intervention, Comparison, Outcome) 设计、标准可获准则以及 20 篇参考文献的数据。三位研究者根据准确性、完整性、相关性、一致性和整体表现等标准,对研究设计和可获准则的质量进行 5 分制评估。对于其他任务,若输出与参考标准一致,则视为准确。检索策略性能通过准确性和检索效能进行评估。筛选准确性分别用于摘要筛选和全文筛选。数据提取准确性在 1,120 个数据点(涵盖 3,360 个独立字段)上进行评估。Claude-3 在 PICO 设计中展现出优异的整体表现。在检索策略表述中,GPT-4 和 Claude-3 取得了可比的准确性,均超越了 Mistral。在摘要筛选中,GPT-4 取得了最高准确率,随后是 Mistral 和 Claude-3。在数据提取方面,GPT-4 显著优于其他模型。大语言模型在自动化系统综述任务中展现出潜力,GPT-4 在检索策略表述、文献筛选和数据提取方面表现突出。这些能力使其成为研究人员值得进一步开发和验证的有力辅助工具。
引用
@article{arxiv.2502.15702,
title = {Large language models streamline automated systematic review: A preliminary study},
author = {Xi Chen and Xue Zhang},
journal= {arXiv preprint arXiv:2502.15702},
year = {2025}
}
备注
25 pages, 9 figures