DebtFree:基于半监督学习最小化自承认技术债务识别中的标注成本
软件工程
2022-01-27 v1 人工智能
摘要
追踪和管理自承认技术债务(SATDs)对于维持健康的软件项目十分重要。当前主动学习的 SATD 识别工具平均需要人工检查 24% 的测试评论才能达到 90% 的召回率。在所有测试评论中,约 5% 为 SATDs。因此人类专家需要阅读近五倍于 SATD 评论的数量,这表明该工具效率低下。此外,人类专家仍易出错:先前工作中 95% 的假阳性标签实为真实阳性。为解决上述问题,我们提出 DebtFree,一种基于无监督学习、用于识别 SATDs 的双模式框架。在模式 1 中,当现有训练数据无标签时,DebtFree 从无监督学习器起步,自动对训练数据中的程序评论进行伪标注。相反,在模式 2 中,若训练数据带有对应标签,DebtFree 从预处理器起步,从测试数据集中识别高疑似 SATDs。随后,我们的机器学习模型用于辅助人类专家手动识别剩余 SATDs。我们在 10 个软件项目上的实验表明,两种模式在有效性上均较最先进的自动化与半自动化模型有统计显著的提升。具体而言,DebtFree 在模式 1(无标签训练数据)中可将标注工作量减少 99%,在模式 2(有标签训练数据)中最多减少 63%,同时将当前主动学习器的 F1 相对提升至近 100%。
引用
@article{arxiv.2201.10592,
title = {DebtFree: Minimizing Labeling Cost in Self-Admitted Technical Debt Identification using Semi-Supervised Learning},
author = {Huy Tu and Tim Menzies},
journal= {arXiv preprint arXiv:2201.10592},
year = {2022}
}
备注
Accepted at EMSE