中文

跨项目缺陷预测中训练数据的简化

软件工程 2014-10-10 v2

摘要

跨项目缺陷预测(CPDP)在估计最易出错的软件组件方面发挥着重要作用,特别是对于新启动或非活跃的项目。据我们所知,鲜有先前的研究就如何从大量公共软件仓库中选择高质量的合适训练数据提供明确指导。本文提出了一种面向实际 CPDP 的训练数据简化方法,考虑了数据集的多粒度层次和过滤策略。此外,我们还就缺陷倾向比率方面合适过滤器的选择提供了定量证据。基于对 10 个开源项目的 34 个版本的实证研究,我们详细比较了使用不同粒度简化的训练数据并结合两种流行过滤器、由五种知名分类器构建的不同缺陷预测器的预测性能。结果表明,当使用带有适当过滤器的多粒度简化方法时,基于朴素贝叶斯(Naive Bayes)的预测模型可实现相当好的性能,并优于基准方法。

关键词

引用

@article{arxiv.1405.0773,
  title  = {Simplification of Training Data for Cross-Project Defect Prediction},
  author = {Peng He and Bing Li and Deguang Zhang and Yutao Ma},
  journal= {arXiv preprint arXiv:1405.0773},
  year   = {2014}
}

备注

17 pages, 12 figures