中文

面向大数据代码机器学习的词汇表建模

计算与语言 2019-04-04 v1 软件工程

摘要

在构建处理源代码的机器学习模型时,必须就源代码词汇表的建模做出若干决策。这些决策可能产生重大影响:某些会导致根本无法训练模型,另一些则会显著影响性能,对神经语言模型尤为如此。然而,这些决策往往未被充分描述。本文列举了源代码词汇表的重要建模选择,并在一个包含 14,436 个项目的大规模语料库上探讨了它们对所得词汇表的影响。我们表明,其中一部分决策具有决定性特征,从而能够在包含 10,106 个项目的大规模语料库上快速训练出准确的神经语言模型。

关键词

引用

@article{arxiv.1904.01873,
  title  = {Modeling Vocabulary for Big Code Machine Learning},
  author = {Hlib Babii and Andrea Janes and Romain Robbes},
  journal= {arXiv preprint arXiv:1904.01873},
  year   = {2019}
}

备注

12 pages, 1 figure