中文

面向集成学习缺陷预测的线上优化中测试策略影响的实证研究

软件工程 2024-09-11 v1

摘要

集成学习方法已用于提高缺陷预测模型的可靠性。然而,单一方法在不同软件项目中是否能获得最高准确率尚无定论。本工作旨在通过帮助选择最高准确率的集成学习方法,提高此类项目中集成学习缺陷预测的性能。我们采用 bandit 算法 (BA) 进行线上优化,以选择最高准确率的集成方法。每个软件模块依次进行测试,bandit 算法利用模块的测试结果来评估集成学习方法的性能。测试策略的选择可能影响应用线上优化时的测试 effort 和预测准确率。因此,我们分析了测试顺序对 BA 性能的影响。在我们的实验中,我们使用六个流行的缺陷预测数据集、四种集成学习方法(如 bagging)以及三种测试策略(如先测试正预测模块,PF)。我们的结果表明,当采用 PF 策略应用 BA 时,平均准确率提高,发现缺陷的数量在六个数据集中至少五个数据集上提高约 7%(尽管与普通集成学习相比的测试 effort 增加约 4%)。因此,BA 配合 PF 策略是实现在各种项目中使用集成方法获得最高预测准确率的最有效方法。

关键词

引用

@article{arxiv.2409.06264,
  title  = {An Empirical Study of the Impact of Test Strategies on Online Optimization for Ensemble-Learning Defect Prediction},
  author = {Kensei Hamamoto and Masateru Tsunoda and Amjed Tahir and Kwabena Ebo Bennin and Akito Monden and Koji Toda and Keitaro Nakasai and Kenichi Matsumoto},
  journal= {arXiv preprint arXiv:2409.06264},
  year   = {2024}
}

备注

6 pages, 6 figures, 6 tables