超越重复:理解与预测问题追踪系统中的链接类型
软件工程
2022-04-28 v1 人工智能
摘要
软件项目使用如 JIRA 等问题追踪系统(ITS)来追踪问题并组织围绕它们的工作流。问题通常通过不同的链接相互关联,例如默认的 JIRA 链接类型:重复、关联、阻塞或子任务。虽然先前的研究主要集中在分析和预测重复链接上,但本工作旨在理解各种其他链接类型、它们的普遍性和特征,以实现更可靠的链接类型预测。为此,我们研究了 15 个公开 JIRA 仓库中连接 698,790 个问题的 607,208 个链接。除了默认类型外,自定义类型依赖、合并、拆分和原因也很常见。我们手动将仓库中使用的所有 75 种链接类型分为五个通用类别:通用关系、重复、组合、时序/因果和工作流。通过比较相应图的结构,我们观察到若干趋势。例如,重复链接倾向于表示通常有两个组件的更简单问题图,而组合链接呈现出最高数量的层次树结构(97.7%)。令人惊讶的是,通用关系链接的传递性得分显著高于重复和时序/因果链接。受链接类型之间差异及其流行度的启发,我们评估了文献中两种最先进的重复检测方法在 JIRA 数据集上的鲁棒性。我们发现,当前的深度学习方法在几乎所有仓库中都会混淆重复链接和其他链接。平均而言,一种方法的分类准确率下降了 6%,另一种下降了 12%。用其他链接类型扩展训练集似乎可以部分解决这个问题。我们讨论了我们的发现及其对研究和实践的影响。
引用
@article{arxiv.2204.12893,
title = {Beyond Duplicates: Towards Understanding and Predicting Link Types in Issue Tracking Systems},
author = {Clara Marie Lüders and Abir Bouraffa and Walid Maalej},
journal= {arXiv preprint arXiv:2204.12893},
year = {2022}
}
备注
19th International Conference on Mining Software Repositories (MSR '22), May 23--24, 2022, Pittsburgh, PA, USA acmDOI: 10.1145/3524842.3528457