学习合成语义解析数据
计算与语言
2021-04-28 v2
摘要
近年来,为语义解析合成数据受到越来越多的关注。然而,大多数方法在其生成过程中需要手工设计(高精度)规则,阻碍了对多样化未知数据的探索。在本工作中,我们提出一种生成模型,其特点在于一个对程序(如 SQL)组合进行建模的(非神经)PCFG,以及一个将程序映射为话语的基于 BART 的翻译模型。由于 PCFG 与预训练 BART 的简洁性,我们的生成模型可基于现有数据高效学习。此外,利用 PCFG 显式建模组合有助于更好地探索未知程序,从而生成更多样化的数据。我们在标准基准 GeoQuery 和 Spider 上分别就文本到 SQL 解析的域内与域外设置评估了我们的方法。实证结果表明,由我们的模型合成的数据可大幅帮助语义解析器实现更好的组合泛化与领域泛化。
引用
@article{arxiv.2104.05827,
title = {Learning to Synthesize Data for Semantic Parsing},
author = {Bailin Wang and Wenpeng Yin and Xi Victoria Lin and Caiming Xiong},
journal= {arXiv preprint arXiv:2104.05827},
year = {2021}
}
备注
NAACL 2021 short paper, fixed citation issue