JuICe:一个用于开放域基于上下文代码生成的大规模远程监督数据集
机器学习
2019-10-10 v2 计算与语言
软件工程
摘要
以交错代码段单元与自然语言markdown为形式的交互式编程近来以Jupyter笔记本的形式日益流行,其加速了原型设计与协作。为研究以长上下文历史为条件的代码生成,我们提出JuICe,一个包含150万例样本、并基于在线编程作业设有3700个实例精选测试集的语料库。与现有上下文代码生成数据集相比,JuICe提供了精炼的人工策展数据、开放域代码,以及数量级更多的训练数据。利用JuICe,我们针对两项任务训练模型:(1)代码单元中API调用序列的生成;(2)完整代码单元生成,两者均以特定代码单元之前的NL-Code历史为条件。使用当前基线代码生成模型的实验表明,上下文与远程监督均有助于生成,且该数据集对当前系统而言具有挑战性。
引用
@article{arxiv.1910.02216,
title = {JuICe: A Large Scale Distantly Supervised Dataset for Open Domain Context-based Code Generation},
author = {Rajas Agashe and Srinivasan Iyer and Luke Zettlemoyer},
journal= {arXiv preprint arXiv:1910.02216},
year = {2019}
}