中文

WebApp1K:面向 Web 应用开发的代码生成基准

软件工程 2024-08-02 v1 人工智能

摘要

我们介绍 WebApp1K,一个用于衡量大型语言模型开发 Web 应用能力的代码生成基准。该基准旨在校准大型语言模型的输出,帮助模型逐步改进代码的正确性和功能性。该基准轻量且易于运行。我们呈现 WebApp1K 的初始版本,并分享我们对最新前沿大型语言模型运行该基准的发现结果。首先,开源大型语言模型的性能表现突出,接近 GPT-4o 和 Claude 3.5。其次,模型规模与代码正确性呈强相关性。第三,未发现任何提示技术能够普遍提升所有模型的性能,或显著提升单个模型的性能。

关键词

引用

@article{arxiv.2408.00019,
  title  = {WebApp1K: A Practical Code-Generation Benchmark for Web App Development},
  author = {Yi Cui},
  journal= {arXiv preprint arXiv:2408.00019},
  year   = {2024}
}