中文

Seq2Seq 模型在代码纠正中的应用

软件工程 2020-08-06 v2

摘要

我们在软件保障参考数据集(SARD)的 Juliet Test Suite 的 C/C++ 和 Java 上应用多种 seq2seq 模型进行编程语言纠正任务,并在这些任务上取得了 75%(C/C++)和 56%(Java)的修复率。我们在这些 seq2seq 模型中引入金字塔编码器(Pyramid Encoder),大幅提升了计算效率和内存效率,同时保持与其非金字塔对应模型相近的修复率。我们利用在 Juliet Test Suite 上预训练的模型通过迁移学习,在 ITC 基准示例(仅 685 个代码实例)上成功完成了错误类型分类任务,指出了一种处理小型编程语言数据集的新途径。

关键词

引用

@article{arxiv.2001.11367,
  title  = {Application of Seq2Seq Models on Code Correction},
  author = {Shan Huang and Xiao Zhou and Sang Chin},
  journal= {arXiv preprint arXiv:2001.11367},
  year   = {2020}
}