中文

探索大型语言模型在系统综述数据提取中的应用:快速可行性研究

计算与语言 2025-02-14 v2 人工智能

摘要

本文描述了使用GPT-4(一种大型语言模型,LLM)对系统综述中的数据提取进行(半)自动化的快速可行性研究。尽管近期对LLM的兴趣激增,但仍缺乏关于如何设计LLM-based自动化工具以及如何对其性能进行稳健评估的了解。在2023年证据综述黑客马拉松期间,我们进行了两项可行性研究。首先,自动从人类临床、动物和社会科学领域的研究中提取研究特征。我们使用该领域的两项研究进行提示开发;并用十项研究进行评估。其次,我们使用LLM预测参与者、干预措施、对照组和结果(PICOs),并在EBM-NLP数据集中的100个摘要中进行标记。总体而言,结果显示准确率约为80%,各领域之间存在差异(人类临床为82%,动物为80%,人类社会科学研究为72%)。数据提取项目中,因果推断方法和研究设计的错误率最高。在PICO研究中,参与者和干预/对照组的准确率很高(>80%),但结果更具挑战性。评估是通过人工完成的;BLEU和ROUGE等评分方法显示出有限的价值。我们观察到LLM预测之间存在变异性,并且响应质量发生变化。本文为未来在系统综述数据提取中评估LLM提供了模板。我们的结果表明,在数据提取中使用LLM可能具有价值,例如作为第二或第三位审阅者。然而,建议对模型如GPT-4集成到工具中时谨慎使用。进一步的研究在实际应用中对每种由LLM处理的数据类型的稳定性和可靠性是必要的。

关键词

引用

@article{arxiv.2405.14445,
  title  = {Exploring the use of a Large Language Model for data extraction in systematic reviews: a rapid feasibility study},
  author = {Lena Schmidt and Kaitlyn Hair and Sergio Graziosi and Fiona Campbell and Claudia Kapp and Alireza Khanteymoori and Dawn Craig and Mark Engelbert and James Thomas},
  journal= {arXiv preprint arXiv:2405.14445},
  year   = {2025}
}

备注

Conference proceedings, peer-reviewed and presented at the 3rd Workshop on Augmented Intelligence for Technology-Assisted Reviews Systems, Glasgow, 2024