Seq2Seq 模型在代码纠正中的应用
软件工程
2020-08-06 v2
摘要
我们在软件保障参考数据集(SARD)的 Juliet Test Suite 的 C/C++ 和 Java 上应用多种 seq2seq 模型进行编程语言纠正任务,并在这些任务上取得了 75%(C/C++)和 56%(Java)的修复率。我们在这些 seq2seq 模型中引入金字塔编码器(Pyramid Encoder),大幅提升了计算效率和内存效率,同时保持与其非金字塔对应模型相近的修复率。我们利用在 Juliet Test Suite 上预训练的模型通过迁移学习,在 ITC 基准示例(仅 685 个代码实例)上成功完成了错误类型分类任务,指出了一种处理小型编程语言数据集的新途径。
引用
@article{arxiv.2001.11367,
title = {Application of Seq2Seq Models on Code Correction},
author = {Shan Huang and Xiao Zhou and Sang Chin},
journal= {arXiv preprint arXiv:2001.11367},
year = {2020}
}