大型语言模型用于流行病学数据提取的自动化水平:基准测试
计算与语言
2025-07-22 v1 人工智能
机器学习
摘要
自动从完整随机对照试验(RCT)中提取数据以用于流行病学综述仍是一个重大挑战。本研究评估了三种大型语言模型(Gemini-2.0-flash、Grok-3、GPT-4o-mini)在涉及统计结果、偏风险评估和研究层次特征的任务中的实际性能,这些任务涉及三个数学医学领域:高血压、糖尿病和骨科学。我们测试了四种不同的提示策略(基本提示、自反思提示、模型集成和定制提示),以确定如何提高提取质量。所有模型都显示出高精度,但 consistently 因遗漏关键信息而表现出差的召回率。我们发现定制提示最为有效,可将召回率提升最高可达 15%。基于这一分析,我们提出了一套三层次的准则,用于匹配大型语言模型在数据提取中的使用水平,依据任务的复杂性和风险。我们的研究为实际流行病学综述中的自动化数据提取提供了实用建议,在有针对性的任务特定自动化中平衡了大型语言模型的效率与专家监督。
引用
@article{arxiv.2507.15152,
title = {What Level of Automation is "Good Enough"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction},
author = {Lingbo Li and Anuradha Mathrani and Teo Susnjak},
journal= {arXiv preprint arXiv:2507.15152},
year = {2025}
}