大语言模型能否替代人工完成系统综述流程?评估GPT-4在多语言同行评审与灰色文献筛选及数据提取中的效能
计算与语言
2024-04-11 v2 人工智能
机器学习
摘要
系统综述对指导实践、研究与政策至关重要,但其往往耗时费力。大语言模型(LLMs)或可加速并自动化系统综述,然而其在此类任务中相对人类的表现尚未被全面评估,且尚无研究测试迄今最大的LLM——GPT-4。这项预注册研究采用‘无人工参与’方法,评估GPT-4在多种文献类型与语言下的标题/摘要筛选、全文评审与数据提取能力。尽管GPT-4在大多数任务上的准确率与人类相当,但结果受随机一致性与数据集不平衡影响而偏移。校正后,数据提取表现中等;除使用高可靠性提示的研究外,各阶段与语言的筛选表现仅为无到中等。在使用高可靠性提示筛选全文文献时,GPT-4表现‘近乎完美’。对GPT-4漏检关键研究施以惩罚并配合高可靠性提示,进一步提升了其表现。我们的发现表明,当前若使用LLMs开展系统综述须高度谨慎,但也提示在可靠提示下的特定系统综述任务中,LLMs可媲美人类表现。
引用
@article{arxiv.2310.17526,
title = {Can large language models replace humans in the systematic review process? Evaluating GPT-4's efficacy in screening and extracting data from peer-reviewed and grey literature in multiple languages},
author = {Qusai Khraisha and Sophie Put and Johanna Kappenberg and Azza Warraitch and Kristin Hadfield},
journal= {arXiv preprint arXiv:2310.17526},
year = {2024}
}
备注
9 pages, 2 figures, 1 table