利用源代码度量与集成方法进行缺陷倾向预测
软件工程
2017-04-17 v1
摘要
软件缺陷预测模型被用于通过在测试阶段前识别易缺陷类来优化测试资源分配。多位研究者已验证使用不同分类技术开发缺陷预测预测模型的有效性。统计模型的性能被证明受训练和测试数据集的影响。集成学习算法被广泛使用,因为它结合了其基学习器对数据集的能力,从而可能获得比单个模型更高的性能(提高泛化能力)。本文所呈现的研究中,应用了三种不同的集成方法来开发缺陷倾向预测模型。缺陷预测模型的有效性和实用性也取决于作为模型输入的源代码度量。本文提出了一个框架来验证源代码度量并选择合适的度量集,旨在提高缺陷预测模型的性能。随后使用成本评估框架验证缺陷预测模型。我们在 45 个开源项目数据集上进行了一系列实验。实验得出的关键结论是:(1)多数投票集成(MVE)方法优于其他方法;(2)使用建议的验证框架选取的源代码度量集作为输入,相比所有其他度量取得了更好的结果;(3)缺陷预测方法对缺陷类百分比低于阈值的软件项目有效(低 - 54.82%,中 - 41.04%,高 - 28.10%)。
引用
@article{arxiv.1704.04383,
title = {Using Source Code Metrics and Ensemble Methods for Fault Proneness Prediction},
author = {Lov Kumar and Santanu Rath and Ashish Sureka},
journal= {arXiv preprint arXiv:1704.04383},
year = {2017}
}
备注
Extended version of the COMPSAC 2017 Paper by same authors