代码生成模型的多语言评估
机器学习
2023-03-30 v3 计算与语言
摘要
我们提出了评估代码生成模型的新基准:MBXP、Multilingual HumanEval 和 MathQA-X。这些数据集涵盖超过 10 种编程语言,并使用一个可扩展的转换框架生成,该框架将原始 Python 数据集中的提示和测试用例转译为目标语言中的相应数据。使用这些基准,我们能够以多语言方式评估代码生成模型的性能,并发现了语言模型在域外语言上的泛化能力、多语言模型相对于单语言模型的优势、few-shot 提示教会模型新语言的能力,甚至在单语言设置下的零样本翻译能力。此外,我们使用我们的代码生成模型执行大规模自举,以获取多种语言的合成规范解,这些解可用于其他与代码相关的评估,如代码插入、鲁棒性或摘要任务。总体而言,我们的基准代表了向更深入理解语言模型代码生成能力迈出的重要一步。我们在 https://github.com/amazon-research/mxeval 上公开发布了我们的代码和数据集。
引用
@article{arxiv.2210.14868,
title = {Multi-lingual Evaluation of Code Generation Models},
author = {Ben Athiwaratkun and Sanjay Krishna Gouda and Zijian Wang and Xiaopeng Li and Yuchen Tian and Ming Tan and Wasi Uddin Ahmad and Shiqi Wang and Qing Sun and Mingyue Shang and Sujan Kumar Gonugondla and Hantian Ding and Varun Kumar and Nathan Fulton and Arash Farahani and Siddhartha Jain and Robert Giaquinto and Haifeng Qian and Murali Krishna Ramanathan and Ramesh Nallapati and Baishakhi Ray and Parminder Bhatia and Sudipta Sengupta and Dan Roth and Bing Xiang},
journal= {arXiv preprint arXiv:2210.14868},
year = {2023}
}
备注
Code and data release: https://github.com/amazon-research/mxeval