CloudEval-YAML:一个面向云配置生成的实用基准
分布式、并行与集群计算
2024-01-17 v1 人工智能
摘要
在蓬勃发展的云计算生态系统和基于大语言模型(LLM)的代码生成工具激增的背景下,缺乏针对云原生应用中代码生成的基准测试。为响应这一需求,我们提出 CloudEval-YAML,一个面向云配置生成的实用基准。CloudEval-YAML 通过聚焦于 YAML——众多云原生工具的事实标准——来应对多样性挑战。我们以实用性为核心开发了 CloudEval-YAML 基准:数据集由针对实际场景的手写问题及其单元测试组成。我们进一步通过以简洁、缩写和双语方式重新表述问题来增强数据集以满足实际需求。该数据集包含 1011 个问题,完成这些问题需要超过 1200 人时。为提升评估期间的实用性,我们为 CloudEval-YAML 构建了一个可扩展的评估平台,相比单机实现了 20 倍加速。据我们所知,CloudEval-YAML 数据集是首个针对云原生应用的手写数据集。我们对 12 个 LLM 进行了深入评估,从而对问题和 LLM 有了更深刻的理解,并揭示了提升任务性能和降低成本的有效方法。
引用
@article{arxiv.2401.06786,
title = {CloudEval-YAML: A Practical Benchmark for Cloud Configuration Generation},
author = {Yifei Xu and Yuning Chen and Xumiao Zhang and Xianshang Lin and Pan Hu and Yunfei Ma and Songwu Lu and Wan Du and Zhuoqing Mao and Ennan Zhai and Dennis Cai},
journal= {arXiv preprint arXiv:2401.06786},
year = {2024}
}