TableQA:用于表感知 SQL 生成的大规模中文文本到 SQL 数据集
数据库
2020-06-12 v1 人工智能
机器学习
摘要
近年来,使用深度神经网络等数据驱动方法将自然语言解析为相应 SQL(NL2SQL)备受关注。现有 NL2SQL 数据集假设条件值应确切出现在自然语言问题中,且给定表即可回答查询。然而,这些假设在实际场景中可能不成立,因为用户可能用不同表述指代表中同一内容,并在不了解表内完整内容的情况下查询表外信息。因此我们提出 TableQA,一个大规模跨领域中文自然语言到 SQL 数据集,包含 64,891 个问题与 20,311 条唯一 SQL 查询,覆盖 6,000 余张表。与现有 NL2SQL 数据集不同,TableQA 不仅要求对不同问题与表模式下的 SQL 骨架具有良好的泛化能力,也要求对条件值的多种表述具有泛化能力。实验结果表明,在 WikiSQL 上条件值准确率达 95.1% 的当前最优模型在 TableQA 上仅获得 46.8% 的条件值准确率与 43.0% 逻辑形式准确率,表明所提数据集具有挑战性且有必要应对。为缓解该问题提出了两种表感知方法,端到端方法在条件值与逻辑形式任务上分别取得 51.3% 与 47.4% 的准确率,分别提升 4.7% 与 3.4%。
引用
@article{arxiv.2006.06434,
title = {TableQA: a Large-Scale Chinese Text-to-SQL Dataset for Table-Aware SQL Generation},
author = {Ningyuan Sun and Xuefeng Yang and Yunfeng Liu},
journal= {arXiv preprint arXiv:2006.06434},
year = {2020}
}