类重平衡技术对缺陷预测模型性能与可解释性的影响
软件工程
2018-02-01 v1
摘要
在类不平衡数据集(即缺陷模块与干净模块的比例未均等表示)上训练的缺陷预测模型极易产生不准确的预测模型。先前的研究比较了类重平衡技术对缺陷预测模型性能的影响。由于使用了不同的数据集、分类技术与性能度量选择,先前的研究工作得出了相互矛盾的结论。此类矛盾结论使得难以推导关于在缺陷预测模型背景下是否应应用类重平衡技术的实践指南。在本文中,我们研究了4种常用类重平衡技术对10种常用性能度量及缺陷预测模型可解释性的影响。我们还构建了统计模型,以更好地理解在哪些实验设计设定下类重平衡技术对缺陷预测模型是有益的。通过对跨越专有与开源系统的101个数据集的案例研究,我们建议:当质量保证团队希望提高识别软件缺陷的完备性(即召回率,Recall)时,类重平衡技术是必需的。然而,在解释缺陷预测模型时应避免类重平衡技术。我们还发现类重平衡技术不影响AUC度量。因此,AUC应作为比较缺陷预测模型时的标准度量。
引用
@article{arxiv.1801.10269,
title = {The Impact of Class Rebalancing Techniques on the Performance and Interpretation of Defect Prediction Models},
author = {Chakkrit Tantithamthavorn and Ahmed E. Hassan and Kenichi Matsumoto},
journal= {arXiv preprint arXiv:1801.10269},
year = {2018}
}
备注
20 pages, under review at a software engineering journal