使用回归模型构建缺陷分类器的影响
软件工程
2022-02-15 v1 机器学习
摘要
将连续缺陷计数离散化为缺陷与非缺陷类,并用作构建缺陷分类器(离散化分类器)的目标变量是常见做法。然而,这种连续缺陷计数的离散化会导致信息损失,可能影响缺陷分类器的性能与可解释性。另一种构建缺陷分类器的可能方法是通过使用回归模型,再将预测的缺陷计数离散化为缺陷与非缺陷类(基于回归的分类器)。本文中,我们在六种常用机器学习分类器(即线性/逻辑回归、随机森林、KNN、SVM、CART与神经网络)和17个数据集上,比较使用两种方法(即离散化分类器与基于回归的分类器)构建的缺陷分类器的性能与可解释性。我们发现:i)基于随机森林的分类器在两种构建方法中均优于其他分类器(最佳AUC);ii)与常见做法相反,使用离散化缺陷计数构建缺陷分类器(即离散化分类器)并不总带来更好性能。因此我们建议未来缺陷分类研究应考虑构建基于回归的分类器(尤其在所建模数据集缺陷率较低时)。此外,我们建议应探索两种构建缺陷分类器的方法,以便在使用最具影响力特征时采用性能最佳的分类器。
引用
@article{arxiv.2202.06157,
title = {The Impact of Using Regression Models to Build Defect Classifiers},
author = {Gopi Krishnan Rajbahadur and Shaowei Wang and Yasutaka Kamei and Ahmed E. Hassan},
journal= {arXiv preprint arXiv:2202.06157},
year = {2022}
}