中文

CORAL:用于分析数据分析的弱监督Transformer代码表示学习

机器学习 2020-09-01 v1 数字图书馆 机器学习

摘要

对源代码尤其是科学源代码的大规模分析,有望更好地理解数据科学过程、识别分析最佳实践,并为科学工具包的构建者提供见解。然而,大型语料库一直缺乏深入分析,因为描述性标签缺失且需要专家领域知识来生成。我们提出了一种新颖的基于弱监督Transformer的架构,用于从抽象语法树和周围自然语言注释计算代码的联合表示。然后我们在一个新的分类任务上评估该模型,即将计算笔记本单元标注为数据分析过程中的阶段,从数据导入到整理、探索、建模和评估。我们表明,我们的模型仅利用易得的弱监督,就比专家提供的启发式方法准确率提高38%,并优于一系列基线。我们的模型使我们能够检查一组118,000个Jupyter Notebook以揭示常见数据分析模式。聚焦于与学术论文相关的笔记本,我们开展了史上最大规模的科学代码研究,发现笔记本构成与相应论文的引用次数相关。

关键词

引用

@article{arxiv.2008.12828,
  title  = {CORAL: COde RepresentAtion Learning with Weakly-Supervised Transformers for Analyzing Data Analysis},
  author = {Ge Zhang and Mike A. Merrill and Yang Liu and Jeffrey Heer and Tim Althoff},
  journal= {arXiv preprint arXiv:2008.12828},
  year   = {2020}
}