中文

通过 CodeWars 的 Katas 评估 GPT 的编程能力

人工智能 2023-06-06 v1 软件工程

摘要

在人工智能(AI)这一蓬勃发展的领域中,理解面向编程的模型的能力与局限至关重要。本文针对从 Codewars 选取的不同难度级别的编程问题,对生成式预训练 Transformer(Generative Pretrained Transformer, GPT)模型(具体而言为 GPT-3.5 与 GPT-4)的编程熟练度进行了新颖的评估。实验揭示了一个位于 3kyu 级别的明显边界,超过该级别后这些 GPT 模型难以给出解决方案。这些发现促成了一种编码问题复杂度度量的提出,该度量同时纳入了问题难度与求解所需时间。本研究强调 AI 模型需要具备验证与创造性思维能力,以更好地模拟人类的问题解决技巧。未来工作旨在精炼这一提出的复杂度度量,以所述能力增强 AI 模型,并开发一种用于编程问题难度的客观度量。本研究的结果为改进 AI 编程能力与推进 AI 问题解决能力的前沿提供了宝贵见解。

关键词

引用

@article{arxiv.2306.01784,
  title  = {Evaluating GPT's Programming Capability through CodeWars' Katas},
  author = {Zizhuo Zhang and Lian Wen and Shaoyang Zhang and David Chen and Yanfei Jiang},
  journal= {arXiv preprint arXiv:2306.01784},
  year   = {2023}
}

备注

9 pages