中文

大型语言模型在自动化 Bug 注入与纠正中的不稳定性分析

软件工程 2025-09-09 v1

摘要

大型语言模型 (LLM) 在软件工程任务中的应用日益增长,尤其是在 bug 修复和代码生成领域。然而,这些模型往往产生不稳定的结果;在相同的输入下以不同时间执行,可能生成截然不同的代码。尽管 LLM 在代码生成方面的不稳定性已在文献中讨论,但 LLM 在 bug 修复任务中的一致性尚未得到彻底评估。本研究旨在考察像 ChatGPT 这样的模型在修复代码 bug 时的不稳定性。我们检查了针对同一提示生成的多个修复建议之间的结构、语法和功能差异,涉及各种错误类型的代码样本。此外,我们评估了不同温度设置 (0、0.5 和 1) 对不稳定性的影响,用于模型的确定性操作。在实验分析中,共计 20 个问题,在每个温度值下生成三个修复建议,比较每个问题的九个不同输出。使用语法相似性和输出等效率 (OER) 指标评估输出的结构和功能一致性。结果表明,随着温度的提高,模型的输出变得更加不稳定和可变,高温结果显示特别高的功能失效率。根据语法相似性分析,高温下的修复建议在结构上存在显著差异,但在低温下结构相对相似。本研究旨在为如何在软件开发过程中更一致地应用基于 LLM 的错误更正系统提供重要方法论见解,同时也对其可靠性表示怀疑。

关键词

引用

@article{arxiv.2509.06429,
  title  = {Analyzing the Instability of Large Language Models in Automated Bug Injection and Correction},
  author = {Mehmet Bilal Er and Nagehan İlhan and Umut Kuran},
  journal= {arXiv preprint arXiv:2509.06429},
  year   = {2025}
}