中文

ChatGPT 4 代码生成能力的评估:19 种编程语言的对比分析

软件工程 2025-01-07 v1 人工智能

摘要

本学士论文考察了 ChatGPT 4 在 19 种编程语言中的代码生成能力。该研究通过一项定量实验,分析了三个难度级别下的解题率、所遇到的错误类型,以及代码在运行时间和内存效率方面的质量。从 LeetCode 平台选取了共计 188 道编程题,并给予 ChatGPT 4 三次机会在反馈下生成正确解答。ChatGPT 4 成功解决了 39.67% 的全部任务,且随着问题复杂度的增加,成功率显著下降。值得注意的是,该模型在所有语言中均难以应对困难问题。ChatGPT 4 在广泛使用的语言中表现出更高的能力,这可能归因于更大规模且更高质量的训练数据。解题率还揭示出模型对低抽象层次和静态类型语言的偏好。对于流行语言,最常见的错误是“答案错误”,而对于不太流行的语言,编译错误和运行时错误占主导,这表明模型对这些语言的结构特征存在频繁的误解与混淆。该模型在所有编程语言中均表现出高于平均水平的运行时间效率,并倾向于静态类型和低抽象层次的语言。内存效率结果差异显著,在 14 种语言中表现高于平均水平,在 5 种语言中表现低于平均水平。观察到在内存效率方面对低抽象层次语言的轻微偏好以及对动态类型语言的倾向。未来的研究应纳入更多任务、迭代次数以及不太流行的语言。此外,可进一步分析 ChatGPT 4 在代码解释与摘要、调试以及复杂实用代码开发方面的能力。

关键词

引用

@article{arxiv.2501.02338,
  title  = {Evaluation of the Code Generation Capabilities of ChatGPT 4: A Comparative Analysis in 19 Programming Languages},
  author = {L. C. Gilbert},
  journal= {arXiv preprint arXiv:2501.02338},
  year   = {2025}
}

备注

65 pages, in German, Bachelor's thesis on the evaluation of ChatGPT 4's code generation capabilities in 19 programming languages, University of Potsdam, June 2024