中文

评估系统性文献综述筛选中提示策略与大语言模型的作用:相关性与任务阶段分类

计算与语言 2025-10-21 v1 人工智能

摘要

本研究量化了提示策略如何与大型语言模型(LLMs)交互,以自动化系统性文献综述(SLR)的筛选阶段。我们在相关性分类和六个二级任务上评估了六个大语言模型(GPT-4o、GPT-4o-mini、DeepSeek-Chat-V3、Gemini-2.5-Flash、Claude-3.5-Haiku、Llama-4-Maverick),并采用五种提示类型(零-shot、few-shot、链条思维(CoT)、CoT-few-shot、自反思),使用准确率、精确率、召回率和 F1 进行评估。结果显示,模型与提示之间的显著交互作用:CoT-few-shot 实现了最可靠的精确率-召回率平衡;零-shot 可最大化高灵敏度通过的召回率;自反思因过度包容和模型间不稳定性而表现不佳。GPT-4o 和 DeepSeek 提供了稳健的整体性能,而 GPT-4o-mini 在显著降低成本方面表现出竞争力。针对相关性分类(每 1000 篇摘要)的成本-性能分析揭示了模型-提示组合之间存在巨大的绝对差异;GPT-4o-mini 在所有提示类型下保持低成本,结构化提示(CoT/CoT-few-shot)在 GPT-4o-mini 上可在较小的增量成本下提供吸引人的 F1 分数。我们建议采用分阶段工作流程:(1)使用低成本模型和结构化提示进行首次筛选,(2)仅将边缘案例升级到更高容量的模型。这些发现凸显了大语言模型在不均衡但有前景的文献筛选自动化潜力。通过系统地分析提示-模型交互,我们提供了比较基准和任务自适应 LLM 部署的实用指导。

关键词

引用

@article{arxiv.2510.16091,
  title  = {Evaluating Prompting Strategies and Large Language Models in Systematic Literature Review Screening: Relevance and Task-Stage Classification},
  author = {Binglan Han and Anuradha Mathrani and Teo Susnjak},
  journal= {arXiv preprint arXiv:2510.16091},
  year   = {2025}
}