面向文本到SQL解析器跨数据库自适应的多样化并行数据合成
计算与语言
2022-11-01 v1 人工智能
机器学习
摘要
Text-to-SQL 解析器通常在训练时未见的数据库上表现不佳。由于新 schema 中缺乏自然语言查询,将解析器适配到新数据库是一个具有挑战性的问题。我们提出 ReFill,一个用于合成高质量且文本多样化的并行数据集以将 Text-to-SQL 解析器适配到目标 schema 的框架。ReFill 学习从已有 schema 中检索并编辑文本查询,并将其迁移到目标 schema。我们表明,检索多样化的已有文本、掩码其 schema 特定词元,并用与目标 schema 相关的词元回填,相比标准 SQL-to-Text 生成方法可得到显著更多样化的文本查询。通过跨越多个数据库的实验,我们证明在由 ReFill 合成的数据集上微调解析器持续优于先前的数据增强方法。
引用
@article{arxiv.2210.16613,
title = {Diverse Parallel Data Synthesis for Cross-Database Adaptation of Text-to-SQL Parsers},
author = {Abhijeet Awasthi and Ashutosh Sathe and Sunita Sarawagi},
journal= {arXiv preprint arXiv:2210.16613},
year = {2022}
}
备注
EMNLP 2022