无监督学习技术在软件缺陷预测中的系统性综述
软件工程
2020-02-20 v4
摘要
背景:无监督机器学习器已越来越多地应用于软件缺陷预测。这种方法对软件从业者可能很有价值,因为它减少了对标记训练数据的需求。目的:调查无监督学习技术在软件缺陷预测中的使用与性能。方法:我们进行了系统性文献综述,识别出49项研究,包含2456个独立的实验结果,这些结果满足我们于2000年1月至2018年3月间发表的纳入标准。为了以一致的方式比较这些研究中的预测性能,我们(重新)计算了混淆矩阵,并采用马修斯相关系数(MCC)作为主要性能度量。结果:我们的元分析表明,对于项目内预测和跨项目预测,无监督模型与有监督模型相当。在14类无监督模型中,模糊C均值(FCM)和模糊自组织映射(FSOMs)表现最佳。此外,在我们能够核查的结果中,我们发现近11%(262/2456)的已发表结果(包含在16篇论文中)内部不一致,另有33%(823/2456)提供的细节不足以让我们核查。结论:尽管许多因素会影响分类器的性能(例如数据集特征),但宽泛地说,在我们的综述中无监督分类器似乎并不比有监督分类器表现更差。然而,我们注意到令人担忧的(i)明显错误的实验结果、(ii)要求不高的基准和(iii)不完整的报告之普遍现象。因此我们鼓励研究者在报告中做到全面。
引用
@article{arxiv.1907.12027,
title = {A Systematic Review of Unsupervised Learning Techniques for Software Defect Prediction},
author = {Ning Li and Martin Shepperd and Yuchen Guo},
journal= {arXiv preprint arXiv:1907.12027},
year = {2020}
}
备注
18 pages, 8 figures