WebApp1K:面向 Web 应用开发的代码生成基准
软件工程
2024-08-02 v1 人工智能
摘要
我们介绍 WebApp1K,一个用于衡量大型语言模型开发 Web 应用能力的代码生成基准。该基准旨在校准大型语言模型的输出,帮助模型逐步改进代码的正确性和功能性。该基准轻量且易于运行。我们呈现 WebApp1K 的初始版本,并分享我们对最新前沿大型语言模型运行该基准的发现结果。首先,开源大型语言模型的性能表现突出,接近 GPT-4o 和 Claude 3.5。其次,模型规模与代码正确性呈强相关性。第三,未发现任何提示技术能够普遍提升所有模型的性能,或显著提升单个模型的性能。
引用
@article{arxiv.2408.00019,
title = {WebApp1K: A Practical Code-Generation Benchmark for Web App Development},
author = {Yi Cui},
journal= {arXiv preprint arXiv:2408.00019},
year = {2024}
}