中文

STAR:面向上下文相关文本到 SQL 解析的 SQL 引导预训练

计算与语言 2022-10-31 v2

摘要

在本文中,我们提出一种新颖的 SQL 引导预训练框架 STAR,用于上下文相关文本到 SQL 解析,其利用上下文信息来丰富文本到 SQL 对话中自然语言(NL)话语和表结构的表示。具体而言,我们提出两个新颖的预训练目标,分别探索每个文本到 SQL 对话中 NL 话语与 SQL 查询的上下文相关交互:(i)模式状态跟踪(SST)目标,以模式状态的形式跟踪和探索上下文相关 SQL 查询的模式状态,通过在交互过程中预测和更新每个模式槽的值;(ii)话语依赖跟踪(UDT)目标,采用加权对比学习将语义相似的两个 NL 话语拉近,并将每个对话中语义不相似的 NL 话语表示推远。此外,我们构建了一个高质量大规模上下文相关文本到 SQL 对话语料库来预训练 STAR。大量实验表明,STAR 在两个下游基准(SParC 和 CoSQL)上取得了新的最先进(SOTA)性能,显著优于先前的预训练方法并在排行榜上位居第一。我们相信所构建语料库、代码库和预训练 STAR 检查点的发布将推动该领域的研究。为可复现性,我们在 https://github.com/AlibabaResearch/DAMO-ConvAI/tree/main/star 发布代码与数据。

关键词

引用

@article{arxiv.2210.11888,
  title  = {STAR: SQL Guided Pre-Training for Context-dependent Text-to-SQL Parsing},
  author = {Zefeng Cai and Xiangyu Li and Binyuan Hui and Min Yang and Bowen Li and Binhua Li and Zheng Cao and Weijie Li and Fei Huang and Luo Si and Yongbin Li},
  journal= {arXiv preprint arXiv:2210.11888},
  year   = {2022}
}

备注

EMNLP 2022