机器学习能否支持系统文献综述更新中的研究筛选?
软件工程
2025-02-13 v1
摘要
[背景] 系统文献综述(SLR)对于综合软件工程(SE)中的证据至关重要,但保持其更新需要大量工作。研究筛选是最耗力的步骤之一,涉及审阅大量研究,并需要多位评审者以最小化偏差和避免证据丢失。[目标] 本研究旨在评估机器学习(ML)文本分类模型能否支持评审者在SLR更新中进行研究筛选。[方法] 我们重现了三位SE研究人员进行的SLR更新的研究筛选。我们使用原始SLR的数据训练了两个监督ML模型(随机森林和支持向量机),采用不同配置。我们以精确率、召回率和F值衡量ML模型对SLR更新的研究筛选效果。我们还比较了人机配对与仅人工配对在筛选研究时的性能。[结果] ML模型取得了适中的F值0.33,不足以实现可靠自动化。然而,我们发现此类模型可在不丢失证据(保持100%召回率)的情况下将研究筛选工作量减少33.9%。我们的分析还表明,评审者双人配对的初始筛选与最终SLR更新结果更加吻合。[结论] 基于我们的结果,我们得出结论:尽管ML模型有助于减少SLR更新中的工作量,但要实现严谨可靠的结果,仍需要经验丰富的评审者在初始筛选阶段的专业知识。
引用
@article{arxiv.2502.08050,
title = {Can Machine Learning Support the Selection of Studies for Systematic Literature Review Updates?},
author = {Marcelo Costalonga and Bianca Minetto Napoleão and Maria Teresa Baldassarre and Katia Romero Felizardo and Igor Steinmacher and Marcos Kalinowski},
journal= {arXiv preprint arXiv:2502.08050},
year = {2025}
}
备注
To appear in Proceedings of the 2025 2nd International Workshop on Methodological Issues with Empirical Studies in Software Engineering, WSESE@ICSE'25