面向大数据代码机器学习的词汇表建模
计算与语言
2019-04-04 v1 软件工程
摘要
在构建处理源代码的机器学习模型时,必须就源代码词汇表的建模做出若干决策。这些决策可能产生重大影响:某些会导致根本无法训练模型,另一些则会显著影响性能,对神经语言模型尤为如此。然而,这些决策往往未被充分描述。本文列举了源代码词汇表的重要建模选择,并在一个包含 14,436 个项目的大规模语料库上探讨了它们对所得词汇表的影响。我们表明,其中一部分决策具有决定性特征,从而能够在包含 10,106 个项目的大规模语料库上快速训练出准确的神经语言模型。
引用
@article{arxiv.1904.01873,
title = {Modeling Vocabulary for Big Code Machine Learning},
author = {Hlib Babii and Andrea Janes and Romain Robbes},
journal= {arXiv preprint arXiv:1904.01873},
year = {2019}
}
备注
12 pages, 1 figure