中文

通过自我改进获得更优的代码语言模型

计算与语言 2023-05-11 v2 人工智能

摘要

代码预训练语言模型(PLMCs)在近期研究中受到关注。这些模型在大规模数据集上使用多模态目标进行预训练。然而,对它们进行微调需要大量监督,并受限于所提供数据集的规模。我们旨在通过提出一个简单的数据增强框架来改善这一问题。我们的框架利用在预训练和微调阶段获得的知识来生成伪数据,随后将其用作下一步的训练数据。我们将该框架整合到最先进的语言模型中,如 CodeT5、CodeBERT 和 UnixCoder。结果表明,我们的框架显著提升了 PLMCs 在代码相关序列生成任务(如 CodeXGLUE 基准中的代码摘要和代码生成)上的性能。

关键词

引用

@article{arxiv.2304.01228,
  title  = {Better Language Models of Code through Self-Improvement},
  author = {Hung Quoc To and Nghi D. Q. Bui and Jin Guo and Tien N. Nguyen},
  journal= {arXiv preprint arXiv:2304.01228},
  year   = {2023}
}

备注

Accepted to Findings, ACL 2023