中文

利用大语言模型进行临床综述的自动化论文筛选

计算与语言 2023-10-09 v1 人工智能

摘要

目的:评估 OpenAI GPT API 在从真实世界临床综述数据集中准确高效地识别相关标题与摘要方面的表现,并将其性能与两名独立人类评审员的真值标注进行比较。方法:我们引入一种使用 OpenAI GPT API 筛选临床综述中标题与摘要的新工作流。我们编写了一个 Python 脚本,以自然语言将筛选标准与经过至少两名人类评审员过滤的标题和摘要数据集语料库发送给 GPT API 进行调用。我们在六篇综述论文上将该模型的表现与人工评审论文进行比较,筛选了超过 24,000 条标题与摘要。结果:我们的结果显示准确率为 0.91,被排除论文的灵敏度为 0.91,被纳入论文的灵敏度为 0.76。在一个随机选取的论文子集上,GPT API 展现出对其决策提供推理的能力,并在被要求解释其推理时对一部分错误分类修正了初始决策。结论:GPT API 有潜力简化临床综述流程,为研究者节省宝贵时间与精力,并提升临床综述的整体质量。通过优先化处理工作流并作为研究者与评审员的辅助而非替代,GPT API 可提高效率并促成医学研究中更准确可靠的结论。

关键词

引用

@article{arxiv.2305.00844,
  title  = {Automated Paper Screening for Clinical Reviews Using Large Language Models},
  author = {Eddie Guo and Mehul Gupta and Jiawen Deng and Ye-Jean Park and Mike Paget and Christopher Naugler},
  journal= {arXiv preprint arXiv:2305.00844},
  year   = {2023}
}

备注

15 pages, 2 figures, 4 tables