基于相似度的实例选择方法在跨项目缺陷预测中的比较
机器学习
2021-04-05 v1 人工智能
软件工程
摘要
背景:已有研究表明,基于最近邻(NN)信息的训练数据实例选择可通过降低训练数据集的异质性,在跨项目缺陷预测(CPDP)中取得更优性能。然而,邻域计算的计算开销高昂,而局部敏感哈希(LSH)等近似方法可与精确方法同样有效。目的:我们旨在比较用于CPDP的实例选择方法,即LSH、NN-filter与遗传实例选择(GIS)。方法:我们在PROMISE仓库的13个数据集上,以5个基学习器进行实验并优化其超参数,从而将LSH与基准实例选择方法NN-Filter和GIS的性能进行比较。结果:统计检验显示出F值性能上的6个显著差异组。前两组仅包含LSH与GIS基准,而末两组仅包含NN-Filter变体。LSH与GIS更偏好召回率而非精确率。事实上,对于精确率性能,检验仅检测出3个显著差异组,其中最高组仅由NN-Filter变体构成。就召回率而言,识别出16个不同组,其中前3组仅含LSH方法,随后6组中的4组仅为GIS,末5组仅含NN-Filter。最后,无论基学习器是否调参,NN-Filter基准从未优于同类的LSH方法;进一步地,它们甚至从未属于同一排名组,意味着在相同学习器与设置下LSH始终显著优于NN-Filter。结论:性能提升加之计算开销与运行时间的降低,使LSH成为一种有前景的方法。然而,LSH的性能基于高召回率,在更看重精确率的环境中应考虑NN-Filter。
引用
@article{arxiv.2104.01024,
title = {A Comparison of Similarity Based Instance Selection Methods for Cross Project Defect Prediction},
author = {Seyedrebvar Hosseini and Burak Turhan},
journal= {arXiv preprint arXiv:2104.01024},
year = {2021}
}
备注
The 36th ACM/SIGAPP Symposium on Applied Computing (SAC'21), 10 pages