中文

阅读 StackOverflow 助长作弊:加入问题文本改进抽取式代码生成

计算与语言 2021-06-09 v1

摘要

仅使用编程问题的标题来作答是困难的,因为关键的上下文信息被省略了。基于这一观察,我们提出了一个包含超过 40,000 条 StackOverflow 问题文本的语料库,与来自 CoNaLa 数据集(Yin et al., 2018)的对应意图结合使用。利用意图和问题正文,我们使用 BART 为该新任务建立了 34.35 的 BLEU 基线分数。我们发现,通过将挖掘的 CoNaLa 数据与标注数据结合,可进一步提升 2.8%2.8\%,达到 35.32 的 BLEU 分数。我们用这些额外数据评估了先前的 SOTA CoNaLa 模型,发现我们提出的使用问题正文与挖掘数据的方法比先前 SOTA 的 BLEU 分数高出 71.96%71.96\%。最后,我们进行消融实验以证明 BART 是一个无监督多模态学习器,并考察其抽取式行为。代码与数据见 https://github.com/gabeorlanski/stackoverflow-encourages-cheating。

关键词

引用

@article{arxiv.2106.04447,
  title  = {Reading StackOverflow Encourages Cheating: Adding Question Text Improves Extractive Code Generation},
  author = {Gabriel Orlanski and Alex Gittens},
  journal= {arXiv preprint arXiv:2106.04447},
  year   = {2021}
}

备注

To be published in ACL-IJCNLP NLP4Prog workshop. (The First Workshop on Natural Language Processing for Programming)