过采样在软件缺陷预测深度学习中价值的研究
软件工程
2021-04-22 v3
摘要
深度学习的一个公认观点是,那些网络首层所展现的自动特征工程使数据科学家无需在运行 DL 之前进行繁琐的手动特征工程。针对缺陷预测深度学习这一具体情形,我们表明该观点是错误的。具体而言,当我们使用一种称为模糊采样(fuzzy sampling)的新颖过采样技术,作为名为 GHOST(面向目标的可扩展训练超参数优化)的更大型流水线的一部分对数据进行预处理时,我们在 14/20 个缺陷数据集上显著优于先前的 DL 最优水平。我们的方法以显著更快的深度学习方法取得了最优结果。这些结果为在软件缺陷预测数据集上应用深度学习之前使用过采样提供了有力依据。
引用
@article{arxiv.2008.03835,
title = {On the Value of Oversampling for Deep Learning in Software Defect Prediction},
author = {Rahul Yedida and Tim Menzies},
journal= {arXiv preprint arXiv:2008.03835},
year = {2021}
}
备注
v3, revision 2 (minor revision); submitted to TSE