中文

AixBench:一个代码生成基准数据集

软件工程 2022-07-22 v2

摘要

我们提出一个用于评估方法级代码生成任务的基准数据集。该基准包含一个含 175 个样本的自动评估数据集和一个含 161 个样本的手动评估数据集。我们还提出了一种用于自动评估生成代码正确性的新指标,以及一组用于手动评估生成代码整体质量的标准。

关键词

引用

@article{arxiv.2206.13179,
  title  = {AixBench: A Code Generation Benchmark Dataset},
  author = {Yiyang Hao and Ge Li and Yongqiang Liu and Xiaowei Miao and He Zong and Siyuan Jiang and Yang Liu and He Wei},
  journal= {arXiv preprint arXiv:2206.13179},
  year   = {2022}
}