面向语义解析的分层神经数据合成
计算与语言
2021-12-07 v1
摘要
语义解析数据集的收集成本高昂。此外,即便对于给定领域相关的问题(即语义解析系统的输入),也可能不易获取,尤其在跨领域语义解析中。这使得数据增强更具挑战性。现有的新数据合成方法使用手工制定或归纳得到的规则,需要大量工程投入与语言学专业知识以实现良好的覆盖度与精度,从而限制了可扩展性。本文中,我们提出一种纯神经的数据增强方法用于语义解析,完全免除了语法工程的需求,同时取得了更高的语义解析准确率。此外,我们的方法可在零样本设定下合成数据,即仅提供新领域模式而没有任何新领域的输入输出样例。在 Spider 跨领域文本到 SQL 语义解析基准上,我们利用零样本增强在开发集上取得了最先进的性能(77.2% 准确率)。
引用
@article{arxiv.2112.02212,
title = {Hierarchical Neural Data Synthesis for Semantic Parsing},
author = {Wei Yang and Peng Xu and Yanshuai Cao},
journal= {arXiv preprint arXiv:2112.02212},
year = {2021}
}