CRUSH4SQL:基于模式幻觉的集体检索用于文本到SQL
计算与语言
2023-11-03 v1
摘要
现有的文本到SQL生成器需要将整个模式与用户文本一起编码。对于具有数万列的大型数据库而言,这种做法代价高昂或不切实际。标准的稠密检索技术不足以对大型结构化数据库进行模式子集选取,因为检索的正确语义要求我们对模式元素的集合而非单个元素进行排序。为此,我们提出了一种两阶段过程,以在检索过程中实现有效覆盖。首先,我们指示一个LLM(大语言模型)幻觉出一个被认为足以回答查询的最小数据库模式。我们利用幻觉出的模式,通过组合多次稠密检索的结果,来检索实际模式的子集。值得注意的是,幻觉——通常被视为一种干扰——实际上被证明作为一种桥接机制是有用的。由于目前不存在用于大型数据库模式子集选取的基准,我们引入了三个基准。两个半合成数据集源自两个知名数据集SPIDER和BIRD的模式并集,分别产生4502和798个模式元素。一个名为SocialDB的真实基准来自一个包含17844个模式元素的实际大型数据仓库。我们表明,我们的方法1带来的召回率显著高于SOTA(当前最优)基于检索的增强方法。
引用
@article{arxiv.2311.01173,
title = {CRUSH4SQL: Collective Retrieval Using Schema Hallucination For Text2SQL},
author = {Mayank Kothyari and Dhruva Dhingra and Sunita Sarawagi and Soumen Chakrabarti},
journal= {arXiv preprint arXiv:2311.01173},
year = {2023}
}
备注
To appear at EMNLP 2023 (Main)