中文

歧义场景下文本到 SQL 生成的基准测试与改进

计算与语言 2023-10-23 v1

摘要

文本到 SQL 转换的研究大多在如下数据集上评测:每个文本查询对应一个正确的 SQL。然而,真实数据库上的自然语言查询常因模式名重叠和多种易混淆的关系路径而存在显著的歧义。为弥补这一差距,我们构建了一个名为 AmbiQT 的新基准,包含超过 3000 个样例,其中每个文本由于词法和/或结构歧义可被解释为两个合理的 SQL。面对歧义时,理想的前 kk 解码器应生成所有有效解释以供用户消歧。我们评估了若干文本到 SQL 系统和解码算法,包括采用最先进 LLM 的系统,发现它们远未达到这一理想。主要原因是主流的束搜索算法及其变体将 SQL 查询视为字符串,并在前 kk 中产生无用的词元级多样性。我们提出 LogicalBeam,一种新解码算法,它利用基于计划的模板生成与约束填充相混合的方式来遍历 SQL 逻辑空间。反事实生成的计划使模板多样化,而仅在模式名上分叉的束搜索填充提供取值多样性。LogicalBeam 在前 kk 排序输出中生成所有候选 SQL 的效率比最先进模型高出至多 2.52.5 倍。它还提升了在 SPIDER 和 Kaggle DBQA 上的前 55 精确匹配与执行匹配准确率。

关键词

引用

@article{arxiv.2310.13659,
  title  = {Benchmarking and Improving Text-to-SQL Generation under Ambiguity},
  author = {Adithya Bhaskar and Tushar Tomar and Ashutosh Sathe and Sunita Sarawagi},
  journal= {arXiv preprint arXiv:2310.13659},
  year   = {2023}
}

备注

To appear at EMNLP 2023 (Main)