中文

关于大语言模型分解错误报告能力的实证研究

软件工程 2025-04-30 v1

摘要

背景:错误报告是软件开发生命周期的关键组成部分。它们帮助开发者跟踪和解决问题,但因其复杂性常被难以处理,可能延迟解决并影响软件质量。目标:本研究探讨大语言模型 (LLM) 是否能够帮助开发者自动将复杂的错误报告分解为更小、自包含的单元,以便更容易理解和解决。方法:我们对从 Apache Jira 收集的 127 条已解决的隐私相关错误报告进行了实证研究。我们评估了 ChatGPT 和 DeepSeek 使用不同的提示策略。我们首先使用零样本提示测试这两种 LLM,然后应用改进的提示(使用演示进行 few-shot 提示)来衡量其在错误分解方面的能力。结果:我们的发现表明,LLM 具备分解错误报告的能力,但其整体性能仍需进一步提高,严重依赖提示质量。使用零样本提示,两种研究的 LLM (ChatGPT 和 DeepSeek) 表现不佳。经过提示调优后,ChatGPT 的真实分解率提高了 140%,DeepSeek 的提高了 163.64%。结论:LLM 在帮助开发者分析和分解复杂错误报告方面显示出潜力,但在准确性和错误理解方面仍需进一步提高。

关键词

引用

@article{arxiv.2504.20911,
  title  = {An Empirical Study on the Capability of LLMs in Decomposing Bug Reports},
  author = {Zhiyuan Chen and Vanessa Nava-Camal and Ahmad Suleiman and Yiming Tang and Daqing Hou and Weiyi Shang},
  journal= {arXiv preprint arXiv:2504.20911},
  year   = {2025}
}