自动参数优化对缺陷预测模型的影响
软件工程
2018-02-01 v1
摘要
缺陷预测模型——识别易缺陷软件模块的分类器——具有控制其特性的可配置参数(例如随机森林中树的数量)。近期研究表明,当使用默认设置时这些分类器表现不佳。在本文中,我们研究自动参数优化对缺陷预测模型的影响。通过对18个数据集的案例研究,我们发现自动参数优化:(1)将AUC性能提升多达40个百分点;(2)产生的分类器至少与采用默认设置训练的分类器一样稳定;(3)大幅改变变量的重要性排序,优化后分类器中排名靠前的变量仅有少至28%也在非优化分类器中排名靠前;(4)对20个最敏感参数中的17个给出可在数据集间迁移且性能无统计显著下降的优化设置;(5)对26种所研究分类技术中的12种仅增加不到30分钟的额外计算。尽管随机森林与支持向量机等广泛使用的分类技术对优化不敏感,但如C5.0与神经网络等传统被忽视的技术在应用优化后实际上可优于广泛使用的技术。这凸显了在使用对参数敏感的分类技术时探索参数空间的重要性。
引用
@article{arxiv.1801.10270,
title = {The Impact of Automated Parameter Optimization on Defect Prediction Models},
author = {Chakkrit Tantithamthavorn and Shane McIntosh and Ahmed E. Hassan and Kenichi Matsumoto},
journal= {arXiv preprint arXiv:1801.10270},
year = {2018}
}
备注
32 pages, accepted at IEEE Transactions on Software Engineering