面向上下文相关文本到SQL的可控数据增强
计算与语言
2023-05-01 v2
摘要
标注数据的规模有限制约了现有的上下文相关文本到SQL模型,原因在于标注的复杂性。数据增强方法是解决该问题的常用手段。然而,当前增强方法生成的数据往往缺乏多样性。本文提出 ConDA,其生成交互式问题及对应的 SQL 结果。我们设计 SQL 对话状态,通过状态转移提升数据多样性。同时,我们提出一种过滤方法,利用 grounding 模型确保数据质量。此外,我们利用 grounding 模型识别并过滤与状态信息不匹配的低质量问题。在 SParC 和 CoSQL 数据集上的实验结果表明,ConDA 使基线模型在复杂问题上平均提升 。我们还对增强数据进行分析,揭示 ConDA 生成的数据在 SQL 模板难度与类型、轮次及问题一致性方面均具高质量。
引用
@article{arxiv.2304.13902,
title = {Controllable Data Augmentation for Context-Dependent Text-to-SQL},
author = {Dingzirui Wang and Longxu Dou and Wanxiang Che},
journal= {arXiv preprint arXiv:2304.13902},
year = {2023}
}
备注
fix overlap