中文

基于信息检索的分类器配置对方法级缺陷定位性能与代价的影响

软件工程 2018-06-21 v1 信息检索

摘要

背景:基于信息检索(IR)的缺陷定位是一种分类器,它根据缺陷报告的内容协助开发人员定位有缺陷的源代码实体(例如文件和函数)。此类IR分类器具有可不同配置的各种参数(例如实体表示方式的选择)。目标:在本文中,我们研究了IR分类器配置的选择对方法级上定位缺陷前top-k性能以及检查源代码实体所需代价的影响。方法:我们在两个软件系统(即Eclipse和Mozilla)的5,266份缺陷报告上执行了共计3,172种大规模分类器配置。结果:我们发现(1)分类器配置的选择对top-k性能的影响为0.44%至36%,对所需代价的影响为4,395至50,000行代码(LOC);(2)具有相似top-k性能的分类器配置可能需要不同的代价;(3)VSM在方法级缺陷定位中同时实现了最佳top-k性能和最少所需代价;(4)随机选取一个性能在最佳top-k分类器配置20%以内的配置之可能性平均仅为5.4%,而代价最少的配置之可能性平均仅为1%;(5)与被分析数据的实体表示相关的配置对top-k性能和所需代价的影响均最大;(6)在方法级获得的最高效分类器配置也可用于文件级(反之亦然)。结论:我们的结果使我们得出结论,配置对方法级缺陷定位的top-k性能和所需代价均有重大影响,这表明应谨慎选择IR配置设置,并且未来的缺陷定位研究应包含所需代价度量。

关键词

引用

@article{arxiv.1806.07727,
  title  = {The Impact of IR-based Classifier Configuration on the Performance and the Effort of Method-Level Bug Localization},
  author = {Chakkrit Tantithamthavorn and Surafel Lemma Abebe and Ahmed E. Hassan and Akinori Ihara and Kenichi Matsumoto},
  journal= {arXiv preprint arXiv:1806.07727},
  year   = {2018}
}

备注

Accepted at Journal of Information and Software Technology (IST)