中文

基于 LLM 的 Bug 报告质量提升:一种实证研究

软件工程 2025-04-29 v1 人工智能

摘要

Bug 报告包含开发人员诊断和修复软件 bug 所需的信息。然而,模糊、不完整或模糊的信息可能导致延迟以及在 bug 诊断和解决过程中消耗过多的手动工作量。本文探讨了指令微调大型语言模型(LLM)是否可以自动将非正式、非结构化的 bug 报告转换为遵循标准模板的高质量、结构化 bug 报告。我们对三个开源指令微调 LLM(Qwen 2.5、Mistral 和 Llama 3.2)进行评估,同时与 ChatGPT-4o 进行比较,衡量其在 CTQRS、ROUGE、METEOR 和 SBERT 等既定指标上的表现。我们的实验表明,微调后的 Qwen 2.5 获得了 \textbf{77%} 的 CTQRS 分数,超过了微调后的 Mistral (\textbf{71%})、Llama 3.2 (\textbf{63%}) 以及 3-shot learning 中的 ChatGPT (\textbf{75%})。进一步分析显示,Llama 3.2 在检测缺失字段(尤其是 Expected Behavior 和 Actual Behavior)方面的准确率更高,而 Qwen 2.5 在捕获 Steps-to-Reproduce 方面表现更佳,F1 分数达到 76%。对模型在其他热门项目(如 Eclipse、GCC)上的额外测试表明,我们的方法在未见项目的 bug 报告上也能很好地推广,CTQRS 可达 \textbf{70%}。这些发现凸显了指令微调在自动化结构化 bug 报告生成方面的潜力,减少了开发人员的手动工作量,提高了软件维护流程的效率。

关键词

引用

@article{arxiv.2504.18804,
  title  = {Can We Enhance Bug Report Quality Using LLMs?: An Empirical Study of LLM-Based Bug Report Generation},
  author = {Jagrit Acharya and Gouri Ginde},
  journal= {arXiv preprint arXiv:2504.18804},
  year   = {2025}
}