基于 Transformer 的神经文本表示技术在缺陷分派上的比较研究
软件工程
2023-10-12 v1 计算与语言
信息检索
摘要
通常,管理缺陷报告的第一步是将缺陷分派给最适合理解、定位并修复目标缺陷的开发人员。此外,将给定缺陷分配给软件项目的特定部分有助于加快修复过程。然而,尽管这些活动十分重要,它们却颇具挑战性,手动分派过程可能耗费数天。过去的研究试图利用缺陷报告有限的文本数据来训练文本分类模型以自动化该过程——取得了不同程度的成功。然而,先前工作所使用的文本表示和机器学习模型受限于其表达能力,往往无法捕捉可能有助于分派过程的细微文本模式。近来,基于大型 Transformer 的预训练神经文本表示技术(如 BERT)在若干自然语言处理任务中取得了更优性能。然而,使用这些技术改进既有自动化缺陷分派方法的潜力尚未得到充分研究或理解。因此,本文中我们提供了首批研究之一,在四个开源数据集上微调基于 Transformer 的语言模型以完成缺陷分派任务,这些数据集共跨越 53 年开发历史,涉及超过 400 名开发人员和 150 多个软件项目组件。我们的研究包含有效性的定量与定性分析。研究结果表明,DeBERTa 在开发人员和组件分配的分派任务中是最有效的技术,且相较于其他技术其性能差异具有统计显著性。然而,通过我们的定性分析,我们也观察到每种技术都具备最适合特定类型缺陷报告的独特能力。
引用
@article{arxiv.2310.06913,
title = {A Comparative Study of Transformer-based Neural Text Representation Techniques on Bug Triaging},
author = {Atish Kumar Dipongkor and Kevin Moran},
journal= {arXiv preprint arXiv:2310.06913},
year = {2023}
}
备注
12 pages, to appear in the Proceedings of 38th IEEE/ACM International Conference on Automated Software Engineering (ASE'23)