中文

桥接文本与表格数据用于跨领域文本到SQL语义解析

计算与语言 2021-01-01 v2 人工智能 数据库 机器学习

摘要

我们提出BRIDGE,一种强大的序列架构,用于跨数据库语义解析中自然语言问题与关系数据库之间依赖关系的建模。BRIDGE将问题和数据库模式表示为带标记序列,其中一部分字段用问题中提及的单元格值进行扩充。该混合序列由BERT编码,仅带最少后续层,文本-DB上下文化通过BERT中微调的深度注意力实现。结合具有模式一致性驱动的搜索空间剪枝的指针-生成器解码器,BRIDGE在流行的跨DB文本到SQL基准Spider(集成模型dev 71.1%、test 67.5%)和WikiSQL(dev 92.6%、test 91.9%)上达到了最先进性能。我们的分析表明BRIDGE有效捕获了所需的跨模态依赖关系,并具有推广到更多文本-DB相关任务的潜力。我们的实现可在 \url{https://github.com/salesforce/TabularSemanticParsing} 获取。

关键词

引用

@article{arxiv.2012.12627,
  title  = {Bridging Textual and Tabular Data for Cross-Domain Text-to-SQL Semantic Parsing},
  author = {Xi Victoria Lin and Richard Socher and Caiming Xiong},
  journal= {arXiv preprint arXiv:2012.12627},
  year   = {2021}
}

备注

EMNLP Findings 2020 long paper extended; 23 pages