OpenCodeInterpreter:集成代码生成、执行与迭代优化
软件工程
2025-01-08 v3 人工智能
计算与语言
摘要
大语言模型的引入显著推进了代码生成。然而,开源模型往往缺乏诸如 GPT-4 Code Interpreter 等先进系统的执行能力和迭代优化能力。为了解决这一问题,我们引入了 OpenCodeInterpreter,一系列旨在生成、执行和迭代优化代码的开源代码系统。在包含 68K 多轮交互数据集 Code-Feedback 的支持下,OpenCodeInterpreter 集成了执行和人类反馈以进行动态代码优化。我们在 HumanEval、MBPP 及其 EvalPlus 增强版本等关键基准上对 OpenCodeInterpreter 进行了全面评估,结果显示出其卓越的性能。值得注意的是,OpenCodeInterpreter-33B 在 HumanEval 和 MBPP 的平均(及 plus 版本)上分别达到了 83.2(76.4)的准确率,紧追 GPT-4 的 84.2(76.2),并在结合来自 GPT-4 的合成人类反馈后进一步提升至 91.6(84.6)。OpenCodeInterpreter 缩小了开源代码生成模型与 GPT-4 Code Interpreter 等专有系统之间的差距。
引用
@article{arxiv.2402.14658,
title = {OpenCodeInterpreter: Integrating Code Generation with Execution and Refinement},
author = {Tianyu Zheng and Ge Zhang and Tianhao Shen and Xueling Liu and Bill Yuchen Lin and Jie Fu and Wenhu Chen and Xiang Yue},
journal= {arXiv preprint arXiv:2402.14658},
year = {2025}
}