大语言模型引导的自调试代码生成
软件工程
2025-06-24 v2 人工智能
摘要
自动化代码生成在智能计算机编程和系统部署中正变得日益重要。然而,当前方法常常面临计算效率方面的挑战,并且缺乏用于代码解析和错误纠正的鲁棒机制。在这项工作中,我们提出了一个新颖的框架PyCapsule,它采用简单而有效的双智能体流水线以及高效的Python代码生成自调试模块。PyCapsule具有复杂的提示推理、迭代错误处理和案例测试功能,确保了高生成稳定性、安全性和正确性。经验表明,与最先进的方法相比,PyCapsule在HumanEval上的成功率提高了5.7%,在HumanEval-ET上提高了10.3%,在BigCodeBench上提高了24.4%。我们还观察到,在更多的自调试尝试下,归一化成功率有所下降,这可能是由于保留过程中有限且嘈杂的错误反馈所致。PyCapsule在推动面向人工智能系统的轻量级高效代码生成方面展现了更广泛的影响。
引用
@article{arxiv.2502.02928,
title = {Large Language Model Guided Self-Debugging Code Generation},
author = {Muntasir Adnan and Zhiwei Xu and Carlos C. N. Kuhn},
journal= {arXiv preprint arXiv:2502.02928},
year = {2025}
}