中文

用于检测自承认技术债务的深度学习与数据增强

软件工程 2025-04-30 v1 人工智能 机器学习

摘要

自承认技术债务 (SATD) 指开发人员使用文本性质器件来解释现有实现不够最优的情形。过去的研究在检测 SATD 方面主要聚焦于两种任务:要么识别 SATD (将 SATD 项目分类为 SATD 或非 SATD),要么对 SATD 进行分类 (将实例标记为涉及需求、设计、代码、测试等债务的 SATD)。然而,这些方法的性能仍不理想,尤其是针对特定类型的 SATD(如测试债务和需求债务),主要由于数据极度不平衡。为此,我们在此基础上利用 BiLSTM 架构进行 SATD 的二进制识别,并采用 BERT 架构对不同类型的 SATD 进行分类。尽管两者都相当有效,但都难以应对不平衡数据。因此,我们采用大语言模型数据增强策略来缓解此问题。此外,我们引入了一个两步方法,用于跨越各类来源数据集的 SATD 识别与分类。我们的贡献包括为未来的 SATD 研究者提供平衡数据集,并表明我们的方法在显著性地提高 SATD 识别与分类性能方面优于基线方法。

关键词

引用

@article{arxiv.2410.15804,
  title  = {Deep Learning and Data Augmentation for Detecting Self-Admitted Technical Debt},
  author = {Edi Sutoyo and Paris Avgeriou and Andrea Capiluppi},
  journal= {arXiv preprint arXiv:2410.15804},
  year   = {2025}
}

备注

Accepted to be published at the 2024 31st Asia-Pacific Software Engineering Conference (APSEC)