被遗忘的搜索查询在基于 IR 的缺陷定位中的作用:一项实证研究
软件工程
2021-09-01 v1 信息检索
机器学习
摘要
基于信息检索(IR)的缺陷定位方法轻量且具成本效益,在查找软件缺陷方面已显示出前景。然而,这些方法的准确性严重依赖于其所用的缺陷报告。大量缺陷报告仅包含纯自然语言文本。根据现有研究,当基于 IR 的方法使用这些缺陷报告作为搜索查询时表现不佳。另一方面,近期有证据表明,即使这些仅含自然语言的报告也包含足够好的关键词,可帮助成功定位缺陷。一方面,这些发现表明仅含自然语言的缺陷报告可能是良好查询关键词的充分来源。另一方面,它们对基于 IR 的缺陷定位中的查询选择实践提出了严重质疑。在本文中,我们试图通过进行一项深入的实证研究来厘清这一方面,该实证研究批判性审视了基于 IR 的缺陷定位中最先进的查询选择实践。特别地,我们使用包含 2,320 份缺陷报告的数据集,采用文献中的十种现有方法,利用基于遗传算法的方法从这些缺陷报告构建最优、近最优搜索查询,然后回答三个研究问题。我们确认,最先进的查询构建方法确实不足以从某些仅含自然语言的缺陷报告构建适当查询(用于缺陷定位),尽管它们包含此类查询。我们还证明,从缺陷报告文本中选取的最优查询与非最优查询在若干关键词特征上显著不同,这使我们获得了可操作的见解。此外,通过将我们的可操作见解应用于非最优查询,我们展示了其性能提升了 27%--34%。
引用
@article{arxiv.2108.05341,
title = {The Forgotten Role of Search Queries in IR-based Bug Localization: An Empirical Study},
author = {Mohammad Masudur Rahman and Foutse Khomh and Shamima Yeasmin and Chanchal K. Roy},
journal= {arXiv preprint arXiv:2108.05341},
year = {2021}
}
备注
57 pages, EMSE (2021)