中文

幽灵回声显现:基准测试可维护性指标与机器学习预测对比人工评估

软件工程 2024-08-21 v1

摘要

随着生成式 AI 预期将增加全球代码量,从人类视角来看可维护性的重要性将变得更加突出。已开发了多种方法来识别最重要的可维护性问题,包括聚合指标和先进的机器学习(ML)模型。本研究对多种可维护性预测方法进行了基准测试,包括最先进(SotA)机器学习、SonarQube 的可维护性评级、CodeScene 的代码健康度和 Microsoft 的可维护性指数。结果表明,CodeScene 达到了 SotA ML 的准确度并超越了普通人工专家。重要的是,与 SotA ML 不同,CodeScene 还能为终端用户提供可操作的代码异味细节以修复已识别的问题。最后,由于 SonarQube 倾向于生成许多假阳性,因此建议对其保持谨慎。不幸的是,我们的发现对之前仅依赖 SonarQube 输出来建立真值标签的研究的有效性提出了质疑。为提高未来可维护性和技术债务研究的可靠性,我们建议采用更准确的指标。此外,使用 Code Health 重新评估先前的发现将有助于缓解这一已暴露的有效性威胁。

关键词

引用

@article{arxiv.2408.10754,
  title  = {Ghost Echoes Revealed: Benchmarking Maintainability Metrics and Machine Learning Predictions Against Human Assessments},
  author = {Markus Borg and Marwa Ezzouhri and Adam Tornhill},
  journal= {arXiv preprint arXiv:2408.10754},
  year   = {2024}
}

备注

Accepted for publication in the Proc. of the 40th International Conference on Software Maintenance and Evolution (ICSME)