中文

数据重采样方法用于跨项目软件缺陷预测有效性的实证研究

软件工程 2022-06-17 v1

摘要

跨项目缺陷预测(CPDP)利用来自不同软件项目的数据来预测缺陷,已被提出作为为缺乏历史数据的软件项目提供数据的一种方式。近期研究使用最近邻(NN)过滤器方法对 CPDP 模型进行评估,显示出有前景的结果。缺陷预测数据集的一个关键挑战是类不平衡,即非缺陷模块远多于缺陷模块的高度偏斜数据集。过去,数据重采样方法已被应用于项目内缺陷预测模型,以帮助缓解数据集中类不平衡的负面影响。为解决 CPDP 中的类不平衡问题,作者评估了在应用 NN 过滤器后数据重采样方法对 CPDP 模型的影响。研究了五种过采样方法(MAHAKIL、SMOTE、Borderline-SMOTE、随机过采样和 ADASYN)与三种欠采样方法(随机欠采样、Tomek Links 和 Onesided selection)对预测性能的影响,并将结果与不使用数据重采样的方法进行比较。作者从 PROMISE 仓库提取的 34 个数据集上考察了六种缺陷预测模型。作者的结果表明,数据重采样对 CPDP 性能有显著正向影响,表明软件质量团队和研究者应考虑应用数据重采样方法以提升召回率(pd)和 g-measure 预测性能。然而,若目标是提高精确率并减少误报(pf),则应避免使用数据重采样方法。

关键词

引用

@article{arxiv.2206.07919,
  title  = {An Empirical Study on the Effectiveness of Data Resampling Approaches for Cross-Project Software Defect Prediction},
  author = {Kwabena Ebo Bennin and Amjed Tahir and Stephen G. MacDonell and Jürgen Börstler},
  journal= {arXiv preprint arXiv:2206.07919},
  year   = {2022}
}

备注

Journal article, 14 pages, 5 tables, 4 figures