中文

XLCoST:一个用于跨语言代码智能的基准数据集

软件工程 2022-06-20 v1 人工智能 机器学习

摘要

机器学习的最新进展显著提升了对源代码数据的理解能力,并在多项下游任务上取得良好性能。GitHub等开源仓库以丰富的无标注代码数据推动了这一过程。然而,高质量标注数据的缺乏在很大程度上阻碍了若干代码相关任务(如程序翻译、摘要生成、合成与代码搜索)的进展。本文介绍XLCoST(Cross-Lingual Code SnippeT dataset,跨语言代码片段数据集),一个用于跨语言代码智能的新基准数据集。我们的数据集包含来自8种语言(7种常用编程语言与英语)的细粒度平行数据,并支持10项跨语言代码任务。据我们所知,无论是规模还是语言数量,它都是最大的源代码平行数据集。我们还提供了各任务上若干state-of-the-art基线模型的性能。我们相信这一新数据集可成为研究界的宝贵资产,并促进跨语言代码智能新方法的开发与验证。

关键词

引用

@article{arxiv.2206.08474,
  title  = {XLCoST: A Benchmark Dataset for Cross-lingual Code Intelligence},
  author = {Ming Zhu and Aneesh Jain and Karthik Suresh and Roshan Ravindran and Sindhu Tipirneni and Chandan K. Reddy},
  journal= {arXiv preprint arXiv:2206.08474},
  year   = {2022}
}

备注

20 pages, 11 tables, 2 figures