中文

研究并理解基于对话式大语言模型的程序修复的有效性与失败

软件工程 2025-04-10 v2

摘要

自动程序修复(APR)旨在自动化缺陷修复过程。近年来,得益于大语言模型(LLMs)的快速发展,自动修复取得了显著进展。由对话式大语言模型驱动的先进 APR 技术,尤其是 ChatGPT,凭借底层大语言模型在提供修复反馈和执行迭代补丁改进方面的能力,展现了令人瞩目的修复能力并日益受到欢迎。尽管具有优越性,对话式 APR 技术仍未能修复大量缺陷。例如,最先进的对话式技术 ChatRepair 未能正确修复 Defects4J 数据集中超过一半的单函数缺陷。为了理解基于对话式大语言模型的修复的有效性与失败,并为改进提供可能的方向,我们以 ChatRepair 为研究对象,重点比较了其填空式修复策略与完整函数修复策略的有效性,评估了其用于补丁改进的关键迭代组件,并分析了修复失败。我们的研究得出一系列发现,我们认为这些发现为未来研究提供了关键启示。

关键词

引用

@article{arxiv.2503.15050,
  title  = {Studying and Understanding the Effectiveness and Failures of Conversational LLM-Based Repair},
  author = {Aolin Chen and Haojun Wu and Qi Xin and Steven P. Reiss and Jifeng Xuan},
  journal= {arXiv preprint arXiv:2503.15050},
  year   = {2025}
}