中文

The Vault:用于推进代码理解与生成的综合多语言数据集

计算与语言 2023-10-31 v2 人工智能 编程语言 软件工程

摘要

我们提出 The Vault,一个包含多种编程语言中高质量代码-文本对的数据集,用于训练大语言模型理解和生成代码。我们提出了通过基于规则和基于深度学习的方法彻底提取样本的方法,以确保其包含高质量的代码与文本对,最终得到包含 4300 万高质量代码-文本对的数据集。我们在代码生成、代码搜索和代码摘要等常见编码任务上的广泛评估表明,当在 The Vault 上微调代码大语言模型时,此类模型优于在相同模型上基于其他数据集(如 CodeSearchNet)训练的结果。我们还对数据集进行了详细分析,以评估各种编程语言和文档字符串对此类模型性能的影响。

关键词

引用

@article{arxiv.2305.06156,
  title  = {The Vault: A Comprehensive Multilingual Dataset for Advancing Code Understanding and Generation},
  author = {Dung Nguyen Manh and Nam Le Hai and Anh T. V. Dau and Anh Minh Nguyen and Khanh Nghiem and Jin Guo and Nghi D. Q. Bui},
  journal= {arXiv preprint arXiv:2305.06156},
  year   = {2023}
}

备注

Accepted at EMNLP 2023, Long Findings