中文

AICoderEval:提升大语言模型在AI领域的代码生成能力

计算与语言 2024-06-10 v1

摘要

自动代码生成是大语言模型(LLM)的一项关键能力。然而,在真实场景中评估这一能力仍然具有挑战性。以往的方法更侧重于低级代码生成(如模型加载),而非生成面向真实世界任务(如图像到文本、文本分类)的高级代码,这些任务涉及多个领域。因此,我们构建了AICoderEval,一个基于HuggingFace、PyTorch和TensorFlow的、专注于各领域真实世界任务的数据集,并提供了全面的评估指标,用于提升LLM在特定任务上的代码生成能力。AICoderEval包含用于自动评估这些任务的测试用例和完整程序,覆盖自然语言处理、计算机视觉和多模态学习等领域。为促进该领域的研究,我们在https://huggingface.co/datasets/vixuowis/AICoderEval开源了AICoderEval数据集。之后,我们提出了CoderGen,一个基于智能体的框架,帮助LLM在构建的AICoderEval上生成与真实世界任务相关的代码。此外,我们训练了一个更强大的特定任务代码生成模型,名为AICoder,该模型基于llama-3在AICoderEval上进行了微调。实验表明,CoderGen在提升LLM的特定任务代码生成能力方面是有效的(原始模型pass@1提升12.00%,ReAct Agent的pass@1提升9.50%)。AICoder也优于当前的代码生成LLM,表明AICoderEval基准具有很高的质量。

关键词

引用

@article{arxiv.2406.04712,
  title  = {AICoderEval: Improving AI Domain Code Generation of Large Language Models},
  author = {Yinghui Xia and Yuyan Chen and Tianyu Shi and Jun Wang and Jinsong Yang},
  journal= {arXiv preprint arXiv:2406.04712},
  year   = {2024}
}