DocuT5:基于表文档的序列到序列SQL生成
计算与语言
2022-11-14 v1
摘要
当前基于预训练语言模型的SQL生成器难以回答需要领域上下文或理解细粒度表结构的复杂问题。人类会通过推理表的文档来处理这些未知情况。基于该假设,我们提出DocuT5,其使用现成的语言模型架构并注入来自外部“文档”的知识以改善领域泛化。我们在包含跨领域、多表的复杂问题的Spider系列数据集上进行实验。具体而言,我们开发了一种新的文本到SQL失败分类法,发现19.6%的错误源于外键错误,49.2%源于缺乏领域知识。我们提出DocuT5,一种从(1)外键的表结构上下文与(2)通过表与列的上下文化获得的领域知识中捕获知识的方法。两类知识均在带约束解码的Spider上优于最先进的T5,且领域知识在Spider-DK和Spider-SYN数据集上取得了可与最先进水平相比的效果。
引用
@article{arxiv.2211.06193,
title = {DocuT5: Seq2seq SQL Generation with Table Documentation},
author = {Elena Soare and Iain Mackie and Jeffrey Dalton},
journal= {arXiv preprint arXiv:2211.06193},
year = {2022}
}