SESR-Eval:用于评估大语言模型在系统综述标题-摘要筛选中表现的数据集
软件工程
2025-12-25 v2
摘要
背景:在系统综述(SR)的标题-摘要筛选过程中使用大语言模型(LLM)已显示出有希望的结果,但受到性能评估有限的制约。目的:创建一个基准数据集,以评估LLM在SR标题-摘要筛选过程中的表现。提供证据说明在软件工程中使用LLM进行标题-摘要筛选是否可取。方法:我们从169个SR研究工件开始,发现其中24个适合纳入数据集。利用该数据集,我们使用9个LLM对标题-摘要筛选进行了基准测试。结果:我们提出了SESR-Eval(软件工程系统综述评估)数据集,包含34,528篇标记的原始研究,这些研究来自发表在软件工程(SE)期刊上的24篇二次研究。大多数LLM表现相似,且二次研究之间筛选准确率的差异大于LLM之间的差异。使用LLM的成本相对较低——即使是最昂贵的模型,每项二次研究的成本也低于40美元。结论:我们的基准测试能够监控AI在软件工程系统综述筛选任务中的表现。目前,由于不同二次研究间的准确率差异很大,且没有LLM能在合理精确度下实现高召回率,因此尚不建议将LLM用于自动化标题-摘要筛选过程。未来,我们计划研究影响不同研究间LLM筛选性能的因素。
引用
@article{arxiv.2507.19027,
title = {SESR-Eval: Dataset for Evaluating LLMs in the Title-Abstract Screening of Systematic Reviews},
author = {Aleksi Huotala and Miikka Kuutila and Mika Mäntylä},
journal= {arXiv preprint arXiv:2507.19027},
year = {2025}
}
备注
An updated post-print on the paper published in the Proceedings of the 19th ACM/IEEE International Symposium on Empirical Software Engineering and Measurement (ESEM '25). 12 pages (10 + 2 pages for references)