面向代码生成的SOTA LLMs全面评估
软件工程
2025-12-23 v1 人工智能
摘要
本研究对六种最新主流大语言模型(LLMs)进行代码生成的全面实证评估,包括通用型和专注代码的模型。我们构建包含944个真实世界LeetCode问题(覆盖五种编程语言)的数据集,并采用严格的评估指标:编译错误、运行时错误、功能失效和算法次优等。结果显示,DeepSeek-R1和GPT-4.1在正确性、效率和鲁棒性方面 consistently 领先于其他模型。通过深入案例分析,我们识别了诸如语法错误、逻辑缺陷和次优算法等常见失败场景,凸显了prompt engineering和人工监督在提升结果方面的关键作用。基于这些发现,我们提供了面向开发者和实践者的可操作性建议,强调成功的LLM部署取决于谨慎的模型选择、有效的prompt设计以及情境感知的使用,以确保在实际软件开发任务中实现可靠的代码生成。
引用
@article{arxiv.2512.18131,
title = {Holistic Evaluation of State-of-the-Art LLMs for Code Generation},
author = {Le Zhang and Suresh Kothari},
journal= {arXiv preprint arXiv:2512.18131},
year = {2025}
}
备注
13 pages, 9 figures, 6 tables