DOMAINEVAL:用于多域代码生成的自动构建基准
人工智能
2024-08-26 v1 软件工程
摘要
代码基准如HumanEval被广泛用于评估大型语言模型(LLM)的能力,提供关于其优势与不足的洞察。然而,当前基准主要检验LLM在常见编码任务(如冒泡排序、最大公约数)上的能力,未涵盖领域特定编码任务(如计算、系统、密码学)。为填补这一空白,我们提出多域代码基准DOMAINEVAL,旨在全面评估LLM的编码能力。我们的管道以自动化方式运行,实现从代码仓库到格式化受试主题的底层构建。通过对12个代表性LLM进行DOMAINEVAL评估,我们观察到LLM在计算任务中表现良好,但在密码学和系统编码任务中表现不足。部分LLM的性能差距可达68.94%(80.94% - 12.0%)。我们还发现,生成更多样本可提升LLM整体性能,但领域偏差可能甚至增加。本研究的贡献包括代码生成基准数据集DOMAINEVAL(涵盖六个热门领域)、用于构建代码基准的完全自动化管道,以及基于DOMAINEVAL中LLM表现识别的编码任务局限性,为未来研究改进提供方向。实验排行榜可访问于https://domaineval.github.io/。
引用
@article{arxiv.2408.13204,
title = {DOMAINEVAL: An Auto-Constructed Benchmark for Multi-Domain Code Generation},
author = {Qiming Zhu and Jialun Cao and Yaojie Lu and Hongyu Lin and Xianpei Han and Le Sun and Shing-Chi Cheung},
journal= {arXiv preprint arXiv:2408.13204},
year = {2024}
}