HumanEval-XL:用于跨语言自然语言泛化的多语言代码生成基准
计算与语言
2024-03-26 v2 编程语言
软件工程
摘要
大型语言模型(LLMs)在从文本提示生成代码方面取得了显著进展。然而,现有基准主要集中在将英语提示翻译为多语言代码,或仅限于非常有限的自然语言(NLs)。这些基准忽视了从大规模多语言 NL 到多语言代码的广阔领域,留下了评估多语言 LLMs 的关键空白。为此,我们引入了 HumanEval-XL,这是一个专门为解决此缺陷而构建的大规模多语言代码生成基准。HumanEval-XL 建立了 23 种自然语言与 12 种编程语言(PLs)之间的连接,包含 22,080 个提示的集合,平均每个提示包含 8.33 个测试用例。通过确保跨多种 NLs 和 PLs 的平行数据,HumanEval-XL 为多语言 LLMs 提供了一个全面的评估平台,允许评估对不同 NLs 的理解能力。我们的工作迈出了填补多语言代码生成领域 NL 泛化评估空白的重要一步。我们的评估代码和数据已在 \url{https://github.com/FloatAI/humaneval-xl} 公开。
引用
@article{arxiv.2402.16694,
title = {HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization},
author = {Qiwei Peng and Yekun Chai and Xuhong Li},
journal= {arXiv preprint arXiv:2402.16694},
year = {2024}
}
备注
LREC-COLING 2024