以更少先验与更多单语数据从自然语言生成代码
计算与语言
2021-06-11 v2 机器学习
摘要
语义解析的训练数据集通常较小,因为标注所需专业水平高于大多数其他NLP任务。因此,该应用的模型通常需要将额外先验知识内置到架构或算法中。对人工专家依赖的增强阻碍了自动化,并在实践中提高了开发与维护成本。本工作研究了一个通用的基于Transformer的seq2seq模型能否以极少的代码生成特定归纳偏置设计取得有竞争力的性能。通过利用相对可观的目标编程语言单语语料库(可从网络廉价挖掘),我们在Django上取得了81.03%的精确匹配准确率,在CoNaLa上取得了32.57的BLEU分数。据我们所知,两者均为SOTA。这一正向证据凸显了在实践中构建准确语义解析器的一条潜在更简易路径。
引用
@article{arxiv.2101.00259,
title = {Code Generation from Natural Language with Less Prior and More Monolingual Data},
author = {Sajad Norouzi and Keyi Tang and Yanshuai Cao},
journal= {arXiv preprint arXiv:2101.00259},
year = {2021}
}
备注
ACL 2021