基于大语言模型集成的高性能自动化摘要筛选
计算与语言
2024-11-25 v2 数字图书馆
信息检索
摘要
大语言模型(LLMs)在需要处理和解释输入文本的任务中表现出色。摘要筛选是系统综述中劳动密集型的环节,涉及对文献检索所识别的大量研究反复应用纳入与排除标准。在此,我们对Cochrane图书馆完整一期中的系统综述进行了试验,评估LLMs(GPT-3.5 Turbo、GPT-4 Turbo、GPT-4o、Llama 3 70B、Gemini 1.5 Pro和Claude Sonnet 3.5)在零样本二分类任务中进行摘要筛选的准确性。对800条记录的试验确定了最优提示策略,并展示了LLMs在灵敏度(LLM-max = 1.000,人类-max = 0.775)、精确率(LLM-max = 0.927,人类-max = 0.911)和平衡准确率(LLM-max = 0.904,人类-max = 0.865)方面优于人类研究人员。表现最佳的LLM-提示组合在所有复制检索结果(n = 119,691)上进行了试验,展现出稳定的灵敏度(范围0.756-1.000)但精确率有所下降(范围0.004-0.096)。66个LLM-人类和LLM-LLM集成实现了完美灵敏度,最大精确率为0.458,且在大规模试验中性能下降更少。不同综述之间观察到显著的性能差异,强调了部署前进行领域特定验证的重要性。LLMs可以在保持或提升准确率与灵敏度的情况下降低系统综述的人力成本。系统综述是包括循证医学在内的各学科证据综合的基础,LLMs有望提高这一研究模式的效率与质量。
引用
@article{arxiv.2411.02451,
title = {High-performance automated abstract screening with large language model ensembles},
author = {Rohan Sanghera and Arun James Thirunavukarasu and Marc El Khoury and Jessica O'Logbon and Yuqing Chen and Archie Watt and Mustafa Mahmood and Hamid Butt and George Nishimura and Andrew Soltan},
journal= {arXiv preprint arXiv:2411.02451},
year = {2024}
}
备注
RS and AJT are joint-first authors