LLM 距离自动 SATD 分类学有多远?
软件工程
2025-10-24 v4
摘要
技术债务指的是降低软件质量的次优代码。当开发人员有意引入此类债务时,称为自承认技术债务 (SATD)。由于 SATD 阻碍维护,识别其类别对于揭示质量问题至关重要。传统上,构建此类分类学需要手动检查 SATD 注释及其周围代码,这既耗时又费力,且由于标注者主观性常常不一致。在本研究中,我们调查了大语言模型 (LLM) 能否生成 SATD 分类学。我们设计了一个结构化的 LLM 驱动流程,镜像研究者通常遵循的分类学构建步骤。我们在量子软件、智能合约和机器学习三个领域的 SATD 数据集上对其进行评估。它成功恢复了先前工作中报告的领域特定类别,例如机器学习中的层配置。它也在两个小时内完成了分类学生成,且即使在最大数据集上也花费不足一美元。这些结果表明,尽管完全自动化仍具有挑战性,但 LLM 可支持半自动 SATD 分类学构建。此外,我们的工作开辟了未来工作的方向,如在其他领域实现自动分类学生成。
引用
@article{arxiv.2506.09601,
title = {How Far Have LLMs Come Toward Automated SATD Taxonomy Construction?},
author = {Sota Nakashima and Yuta Ishimoto and Masanari Kondo and Tao Xiao and Yasutaka Kamei},
journal= {arXiv preprint arXiv:2506.09601},
year = {2025}
}
备注
5 pages, APSEC 2025