多少次尝试才够?面向 LLM 代码生成的迭代自我修复
人工智能
2026-04-14 v1 人机交互
摘要
大语言模型频繁在首次尝试时生成错误代码,但大多数基准测试仅在单次设置下进行评估。我们调查了跨七个模型、三个模型家族以及开源和专有提供商的迭代自我修复(将执行错误反馈给模型进行纠正):Llama 3.1 8B、Llama 3.3 70B、Llama 4 Scout(MoE,16 个专家)、Llama 4 Maverick(MoE,128 个专家)、Qwen3 32B、Gemini 2.5 Flash 和 Gemini 2.5 Pro。在 HumanEval(164 个问题)和 MBPP Sanitized(257 个问题)上进行最多五次尝试的评估,自我修复普遍提升了通过率:HumanEval 提升 4.9 到 17.1 个百分点,MBPP 提升 16.0 到 30.0 个百分点。Gemini 2.5 Flash 实现了最高的最终通过率(HumanEval 96.3%,MBPP 93.8%)。大多数收益集中在前两个轮次。错误类型分析显示,断言错误(逻辑错误)在修复方面约为 45%,而语法和名称错误修复率显著更高,这联系到 LLM 自我纠错局限性的更广泛发现。先前研究发现较弱模型在自我修复中失败或需要微调;我们表明现代指令微调模型仅通过提示即可成功,即使在 8B 参数规模也能做到。我们还提供了稠密模型和 MoE 架构自我修复的首次比较,并将修复-重采样权衡分析扩展到现代模型。提示消除实验表明,链式思考修复比最小化提示在有能力的模型上实现最高多达 5.5 个百分点的额外自我修复收益(测量为修复增量的改进)。
引用
@article{arxiv.2604.10507,
title = {Beyond Compliance: A Resistance-Informed Motivation Reasoning Framework for Challenging Psychological Client Simulation},
author = {Danni Liu and Bo Liu and Yuxin Hu and Hantao Zhao and Yan Liu and Ding Ding and Jiahui Jin and Jiuxin Cao},
journal= {arXiv preprint arXiv:2604.10507},
year = {2026}
}