中文

面向文本到SQL的结构接地预训练

计算与语言 2022-09-01 v3 人工智能

摘要

学习捕捉文本-表格对齐对于文本到SQL等任务至关重要。模型需要正确识别对列和值的自然语言指代,并将其接地于给定的数据库模式中。在本文中,我们提出了一种新颖的弱监督结构接地预训练框架(StruG)用于文本到SQL,其可基于平行文本-表格语料库有效学习捕捉文本-表格对齐。我们确定了一组新颖的预测任务:列接地、值接地和列-值映射,并利用它们预训练一个文本-表格编码器。此外,为了在更真实的文本-表格对齐设定下评估不同方法,我们基于Spider开发集创建了一个去除显式列名提及的新评估集Spider-Realistic,并采用八个现有文本到SQL数据集进行跨数据库评估。STURG在全部设定下相较BERT-LARGE带来显著提升。与GRAPPA等现有预训练方法相比,StruG在Spider上取得相似性能,并在更真实的集合上超越所有基线。Spider-Realistic数据集可从 https://doi.org/10.5281/zenodo.5205322 获取。

关键词

引用

@article{arxiv.2010.12773,
  title  = {Structure-Grounded Pretraining for Text-to-SQL},
  author = {Xiang Deng and Ahmed Hassan Awadallah and Christopher Meek and Oleksandr Polozov and Huan Sun and Matthew Richardson},
  journal= {arXiv preprint arXiv:2010.12773},
  year   = {2022}
}

备注

Accepted to NAACL 2021. The Spider-Realistic dataset is available at https://doi.org/10.5281/zenodo.5205322