面向文本不相似度对重复缺陷报告检测影响的理解
软件工程
2022-12-21 v1
摘要
约40%的软件缺陷报告彼此重复,这在软件维护期间造成了主要开销。传统技术通常侧重于检测文本相似的重复缺陷报告。然而,在缺陷跟踪系统中,许多重复缺陷报告可能并不文本相似,传统技术对此可能力有不逮。在本文中,我们开展了一项大规模实证研究,以更好地理解文本不相似度对重复缺陷报告检测的影响。首先,我们从三个开源系统收集了共计92,854份缺陷报告,并构建了包含文本相似和文本不相似重复缺陷报告的两个数据集。随后,我们确定了三种现有技术在检测重复缺陷报告上的性能,并表明它们对文本不相似重复报告的性能显著较差。其次,我们结合描述性分析、词嵌入可视化和人工分析对两组缺陷报告进行分析。我们发现,文本不相似的重复缺陷报告常缺失重要组件(例如,预期行为和复现步骤),这可能导致其文本差异以及现有技术的较差性能。最后,我们将领域特定嵌入应用于重复缺陷报告检测问题,结果显示好坏参半。上述所有发现都值得进一步研究,并需要更有效的解决方案来检测文本不相似的重复缺陷报告。
引用
@article{arxiv.2212.09976,
title = {Towards Understanding the Impacts of Textual Dissimilarity on Duplicate Bug Report Detection},
author = {Sigma Jahan and Mohammad Masudur Rahman},
journal= {arXiv preprint arXiv:2212.09976},
year = {2022}
}
备注
Accepted in the 30th edition of the IEEE International Conference on Software Analysis, Evolution and Reengineering (SANER 2023), which will be held at the Macau University of Science and Technology in Macao SAR, China, 2023