比较大型语言模型与人类程序员在生成编程代码方面的表现
软件工程
2025-01-22 v2 人工智能
计算与语言
编程语言
摘要
我们系统地评估了七个大型语言模型在使用各种提示策略、编程语言和任务难度下生成编程代码的性能。GPT-4 大幅优于其他大型语言模型,包括 Gemini Ultra 和 Claude 2。GPT-4 的代码生成性能随不同的提示策略而有很大差异。在本研究评估的大多数 LeetCode 和 GeeksforGeeks 编程竞赛中,采用最佳提示策略的 GPT-4 超过了 85% 的人类参与者。此外,GPT-4 在不同编程语言之间翻译代码以及从过去的错误中学习方面表现出强大的能力。GPT-4 生成代码的计算效率与人类程序员相当。这些结果表明,GPT-4 有潜力成为编程代码生成和软件开发中可靠的助手。
引用
@article{arxiv.2403.00894,
title = {Comparing large language models and human programmers for generating programming code},
author = {Wenpin Hou and Zhicheng Ji},
journal= {arXiv preprint arXiv:2403.00894},
year = {2025}
}