多版本项目缺陷数据集中不一致标签的广泛实证研究
软件工程
2021-01-29 v1
摘要
缺陷数据集的标签质量对缺陷预测模型的可靠性有直接影响。本研究针对多版本项目缺陷数据集,提出一种自动检测标签不一致实例(即同一软件项目多个版本中源代码相同但标签不同的现象)的方法,并理解其对缺陷预测模型评估与解释的影响。基于以不同方法收集的五个多版本项目缺陷数据集(文献中广泛使用或最新),我们发现:(1)所调查缺陷数据集的大部分版本均含有不同程度的不一致标签;(2)训练数据集中不一致标签的存在可能显著改变缺陷预测模型的预测性能,并可能导致识别出实质不同的真实缺陷模块;(3)缺陷预测模型中自变量的重要性排序会因不一致标签的存在而发生实质偏移。上述发现揭示,缺陷数据集中的不一致标签会深刻改变缺陷预测模型的预测能力与解释性。因此,我们强烈建议从业者检测并排除缺陷数据集中的不一致标签,以避免其对缺陷预测模型的潜在负面影响。此外,研究者有必要改进现有缺陷标签收集方法以减少不一致标签。进而,有必要使用具有高不一致标签比例的多版本项目缺陷数据集重新检验以往研究的实验结论。
引用
@article{arxiv.2101.11749,
title = {An extensive empirical study of inconsistent labels in multi-version-project defect data sets},
author = {Shiran Liu and Zhaoqiang Guo and Yanhui Li and Chuanqi Wang and Lin Chen and Zhongbin Sun and Yuming Zhou},
journal= {arXiv preprint arXiv:2101.11749},
year = {2021}
}
备注
63 pages, 24 figures, 14 tables