中文

基于 Transformer-XL 的源代码语言建模

机器学习 2020-08-03 v1 计算与语言 软件工程

摘要

已发现软件如同自然语言文本一样表现出“自然性”,可被统计语言模型捕捉。近年来,人们提出神经语言模型通过深度学习表征软件的自然性。在本文中,我们对最先进的源代码神经语言模型(包括基于 RNN 的模型和基于 Transformer-XL 的模型)进行实验评估。通过在大规模 Python 代码语料库上的实验,我们发现 Transformer-XL 模型在以远低的计算成本捕捉软件自然性方面优于基于 RNN 的模型(包括 LSTM 和 GRU 模型)。

关键词

引用

@article{arxiv.2007.15813,
  title  = {Language Modelling for Source Code with Transformer-XL},
  author = {Thomas Dowdell and Hongyu Zhang},
  journal= {arXiv preprint arXiv:2007.15813},
  year   = {2020}
}