通过细粒度查询理解改进 Text-to-SQL 语义解析
计算与语言
2022-09-30 v1
摘要
近期大多数关于 Text-to-SQL 语义解析的研究依赖于解析器自身或基于简单启发式的方法来理解自然语言查询(NLQ)。在合成 SQL 查询时,解析器无法获得 NLQ 的显式语义信息,导致泛化性能不理想。此外,若无词法级细粒度查询理解,查询与数据库之间的链接只能依赖模糊字符串匹配,导致在实际应用中的次优性能。鉴于此,本文提出一个通用的、基于 token 级细粒度查询理解的模块化神经语义解析框架。我们的框架由三个模块组成:命名实体识别器(NER)、神经实体链接器(NEL)和神经语义解析器(NSP)。通过联合建模查询与数据库,NER 模型分析用户意图并识别查询中的实体。NEL 模型将带类型的实体链接到数据库中的 schema 和单元格值。解析器模型利用可用的语义信息和链接结果,并基于动态生成的文法合成树结构 SQL 查询。在最新发布的语义解析数据集 SQUALL 上的实验表明,我们能在 WikiTableQuestions(WTQ)测试集上达到 56.8% 的执行准确率,比最先进模型高出 2.7%。
引用
@article{arxiv.2209.14415,
title = {Improving Text-to-SQL Semantic Parsing with Fine-grained Query Understanding},
author = {Jun Wang and Patrick Ng and Alexander Hanbo Li and Jiarong Jiang and Zhiguo Wang and Ramesh Nallapati and Bing Xiang and Sudipta Sengupta},
journal= {arXiv preprint arXiv:2209.14415},
year = {2022}
}
备注
EMNLP Industry Track 2022