用于系统综述数据提取的人类在环验证的大语言模型
人机交互
2025-01-22 v1
摘要
系统综述是一项耗时的工作。历史上,知识丰富的人类必须在数据可被分析之前对研究进行筛选和提取。然而,大语言模型(LLM)有望大大加速这一过程。我们在先行研究中发现其前景非常广阔后,调查了使用可免费获取的 LLM 用于系统综述数据提取的可能性。我们使用三个不同的 LLM,从112项被纳入已发表范围综述的研究中提取24种类型的数据,包括9个明确给出的变量和15个派生的分类变量。总体而言,我们发现 Gemini 1.5 Flash、Gemini 1.5 Pro 和 Mistral Large 2 分别在数据被人类编码一致性方面表现为71.17%、72.14%和62.43%。虽然前景光明,但这些结果凸显了对于 AI 辅助数据提取需要人类在环(HIL)过程的迫切需求。因此,我们present了一个我们开发的免费、开源程序(AIDE),用于促进用户友好、带有 HIL 数据提取的 LLM。
引用
@article{arxiv.2501.11840,
title = {Large Language Models with Human-In-The-Loop Validation for Systematic Review Data Extraction},
author = {Noah L. Schroeder and Chris Davis Jaldi and Shan Zhang},
journal= {arXiv preprint arXiv:2501.11840},
year = {2025}
}