中文

StaQC:从Stack Overflow系统挖掘的Question-Code数据集

计算与语言 2018-03-28 v1

摘要

Stack Overflow (SO) 一直是自然语言问题及其代码解决方案(即question-code对)的重要来源,这对于包括代码检索和标注在内的许多任务至关重要。在现有的大多数研究中,question-code对是启发式收集的,质量往往较低。在本文中,我们研究了一个从Stack Overflow系统挖掘question-code对的新问题(与启发式收集形成对比)。该问题被形式化为预测一个代码片段是否是一个问题的独立解决方案。我们提出了一种新颖的双视图层次神经网络,它可以同时捕获代码片段的编程内容和文本上下文(即两个视图)以进行预测。在Python和SQL领域的两个手动标注数据集上,我们的框架大幅优于启发式方法,F1值和准确率至少高出15%。此外,我们提出了StaQC(Stack Overflow Question-Code对),这是迄今为止使用我们的框架从SO自动挖掘出的最大数据集,包含约148K个Python和约120K个SQL question-code对。在各种案例研究下,我们证明了StaQC能够极大地帮助开发将自然语言与编程语言相关联的缺乏数据模型。

关键词

引用

@article{arxiv.1803.09371,
  title  = {StaQC: A Systematically Mined Question-Code Dataset from Stack Overflow},
  author = {Ziyu Yao and Daniel S. Weld and Wei-Peng Chen and Huan Sun},
  journal= {arXiv preprint arXiv:1803.09371},
  year   = {2018}
}

备注

Accepted to the Web Conference 2018 (former WWW 2018), 11 pages, 6 figures