基于分级练习的 LLM 代码生成能力评估
软件工程
2024-10-23 v1 人工智能
计算与语言
摘要
大型语言模型在从自然语言描述生成功能代码方面显示出突出的能力。然而,仍缺乏一种客观且不偏向的方法来评估这些能力。本文综述了当前可用于此目的的评估方法,并对一种最先进模型(GPT4-o-mini) 在来自 Codewars 的 8 种编程语言中解决精选编码挑战的性能进行了新的评估。我们的分析显示,模型成功的概率与任务难度、所用编程语言的流行度以及挑战发布时间的间隔程度呈正相关。进一步的近似性解释分析表明,约 46.6% 的模型绩效可归因于任务难度,约 37.4% 似乎与挑战解决方案泄露到模型训练集中有关,其余 16% 取决于编程语言。这些结果表明,当前的评估方法可能高估了大型语言模型生成功能代码的实际技能。
引用
@article{arxiv.2410.16292,
title = {An evaluation of LLM code generation capabilities through graded exercises},
author = {Álvaro Barbero Jiménez},
journal= {arXiv preprint arXiv:2410.16292},
year = {2024}
}