EnHMM:利用集成 HMM 与堆栈跟踪预测缺陷报告字段的重分配
摘要
缺陷报告(BR)包含可帮助分派团队确定优先级并将缺陷分配给将提供修复的开发者的重要信息。然而,研究表明 BR 字段常含需被重分配的错误信息,这延误了缺陷修复过程。现有方法可预测 BR 字段是否应被重分配。这些研究主要使用 BR 描述与传统机器学习算法(SVM、KNN 等),因而未充分利用 BR 数据中的信息顺序,如 BR 堆栈跟踪中的函数调用序列,而这或许对提升预测精度颇有价值。本文提出一种称为 EnHMM 的新方法,利用训练于堆栈跟踪上的集成隐马尔可夫模型(HMM)预测 BR 字段的重分配。EnHMM 借助 HMM 表示序列数据的天然能力来建模 BR 堆栈跟踪中函数调用的时序顺序。应用于 Eclipse 与 Gnome 的 BR 仓库时,EnHMM 在 Eclipse 数据集上取得平均精确率、召回率与 F 值 54%、76%、60%,在 Gnome 数据集上取得 41%、69%、51%。我们还发现 EnHMM 相较最佳单一 HMM 在 Eclipse 上提升 36%,在 Gnome 上提升 76%。最后,将 EnHMM 与近期领域方法 Im.ML.KNN 比较,我们发现 EnHMM 的平均 F 值较 Im.ML.KNN 提升 6.80%,平均召回率较 Im.ML.KNN 提升 36.09%。但 EnHMM 的平均精确率低于 Im.ML.KNN(53.93% 对比 56.71%)。
引用
@article{arxiv.2103.08083,
title = {EnHMM: On the Use of Ensemble HMMs and Stack Traces to Predict the Reassignment of Bug Report Fields},
author = {Md Shariful Islam and Abdelwahab Hamou-Lhadj and Korosh K. Sabor and Mohammad Hamdaqa and Haipeng Cai},
journal= {arXiv preprint arXiv:2103.08083},
year = {2021}
}
备注
Published in Proceedings of the 28th IEEE International Conference on Software Analysis, Evolution and Reengineering (SANER 2021), 11 pages, 7 figures