开源模型能否战胜 ChatGPT?——大型语言模型文本到代码生成的比较研究
计算与语言
2024-09-09 v1 机器学习
软件工程
摘要
近年来,大型语言模型(LLMs)作为强大的工具在 various fields 中展现出潜在应用,包括软件工程。在本研究范围内,我们评估了五种不同状态的大型语言模型——Bard、BingChat、ChatGPT、Llama2 和 Code Llama——其在文本到代码生成方面的能力。通过对来自编程网站 LeetCode 的编码问题的文本描述输入给这些模型,以生成 Python 解决方案为任务进行实证研究。随后,使用 LeetCode 的测试功能对生成输出的质量进行评估。结果表明,所调查模型之间表现存在显著差异。ChatGPT 能够处理这些典型编程挑战,甚至超过代码专用模型如 Code Llama。为获得更深入的见解,我们测量了生成输出的运行时间和内存使用情况,并将其与 LeetCode 其他代码提交进行比较。通过详细的错误分析,包括对正确缩进和生成代码形式的差异进行比较,以及将未正确解决的任务分配到特定错误类别,从而为我们获得更细致的结果和潜在改进的图景。结果还显示,当模型面临大量上下文形式的较长提示时,产生的错误代码呈现出明显的递增模式。
引用
@article{arxiv.2409.04164,
title = {Can OpenSource beat ChatGPT? -- A Comparative Study of Large Language Models for Text-to-Code Generation},
author = {Luis Mayer and Christian Heumann and Matthias Aßenmacher},
journal= {arXiv preprint arXiv:2409.04164},
year = {2024}
}
备注
Conference Paper accepted at the 9th SwissText Conference (2024)