中文

“更好的数据”是否优于“更好的数据挖掘器”?(论为缺陷预测调优 SMOTE 的益处)

软件工程 2018-03-16 v3

摘要

我们报告并修正了先前对软件分析中的分类器进行排名的研究中的一个重要系统性错误。那些研究没有 (a) 基于多重标准评估分类器,也没有 (b) 研究数据变化如何影响结果。因此,本文应用 (a) 多标准检验,同时 (b) 修复训练数据中较弱的区域(使用 SMOTUNED,它是 SMOTE 的自调优版本)。该方法在软件缺陷预测上带来了极大的提升。当应用于来自开源系统的 3,681 个 JAVA 类(包含超过一百万行代码)的 5*5 交叉验证研究时,SMOTUNED 将 AUC 和召回率分别提高了 60% 和 20%。这些改进与用于质量预测的分类器无关。当对 SMOTE 和 SMOTUNED 与最新的类不平衡技术进行比较分析时,也观察到了相同类型的模式(改进)。总之,对于像缺陷预测这样的软件分析任务,(1) 数据预处理可能比分类器选择更重要,(2) 没有此类预处理的排名研究是不完整的,以及 (3) SMOTUNED 是一个有前景的预处理候选方法。

关键词

引用

@article{arxiv.1705.03697,
  title  = {Is "Better Data" Better than "Better Data Miners"? (On the Benefits of Tuning SMOTE for Defect Prediction)},
  author = {Amritanshu Agrawal and Tim Menzies},
  journal= {arXiv preprint arXiv:1705.03697},
  year   = {2018}
}

备注

10 pages + 2 references. Accepted to International Conference of Software Engineering (ICSE), 2018