缺陷报告太少?探索数据增强以改善基于变更集的缺陷定位
软件工程
2023-06-02 v2
摘要
基于 transformer(如 BERT、RoBERTa)的现代深度学习(DL)架构在多项自然语言任务上展现出性能提升。尽管此类 DL 模型在软件工程应用中显示出巨大潜力,但它们常受限于训练数据不足。尤其受限的是需要项目特定数据的应用,例如缺陷定位,其目标是推荐用于修复新提交缺陷报告的代码。用于缺陷定位的深度学习模型需要大量已修复缺陷报告的训练集,而即使在热门且活跃开发的软件项目中,这类数据数量也有限。本文中,我们考察了在基于 transformer 的 DL 模型上使用合成训练数据的效果,这些模型执行一种更复杂的缺陷定位变体,旨在为每个缺陷报告检索引发缺陷的变更集。为生成高质量合成数据,我们提出了作用于缺陷报告不同组成成分上的新型数据增强算子。我们还描述了一种数据平衡策略,旨在创建更能反映整个代码库的补全缺陷报告语料,因为用作训练数据的现有缺陷报告通常只涉及代码库的一小部分。
引用
@article{arxiv.2305.16430,
title = {Too Few Bug Reports? Exploring Data Augmentation for Improved Changeset-based Bug Localization},
author = {Agnieszka Ciborowska and Kostadin Damevski},
journal= {arXiv preprint arXiv:2305.16430},
year = {2023}
}