LLM 是否已能充当数据库接口?面向大规模数据库支撑的文本到 SQL 的 BIRD 大基准
计算与语言
2023-11-16 v3
摘要
文本到 SQL 解析旨在将自然语言指令转换为可执行的 SQL,近年来受到越来越多的关注。特别是 Codex 和 ChatGPT 在该任务上展示了令人印象深刻的结果。然而,大多数主流基准(即 Spider 和 WikiSQL)聚焦于仅有少量数据库内容的数据库模式,留下了学术研究与实际应用之间的鸿沟。为缓解这一鸿沟,我们提出 BIRD,一个面向大规模数据库支撑的文本到 SQL 任务的大基准,包含 12,751 对文本到 SQL 数据以及 95 个数据库,总大小 33.4 GB,覆盖 37 个专业领域。我们对数据库值的强调凸显了脏数据库内容、自然语言问题与数据库内容间的外部知识以及 SQL 效率的新挑战,尤其在海量数据库背景下。为解决这些问题,文本到 SQL 模型除语义解析外还必须具备数据库值理解能力。实验结果表明了数据库值对于为大型数据库生成准确文本到 SQL 的重要性。此外,即便最有效的文本到 SQL 模型(即 ChatGPT)在执行准确率上也仅达到 40.08%,仍远落后于人类 92.96% 的结果,证明挑战依旧存在。除此之外,我们还提供了效率分析,以洞察生成有益于工业界的文本到高效 SQL。我们相信 BIRD 将推动文本到 SQL 研究的实际应用。排行榜与源代码见:https://bird-bench.github.io/。
引用
@article{arxiv.2305.03111,
title = {Can LLM Already Serve as A Database Interface? A BIg Bench for Large-Scale Database Grounded Text-to-SQLs},
author = {Jinyang Li and Binyuan Hui and Ge Qu and Jiaxi Yang and Binhua Li and Bowen Li and Bailin Wang and Bowen Qin and Rongyu Cao and Ruiying Geng and Nan Huo and Xuanhe Zhou and Chenhao Ma and Guoliang Li and Kevin C. C. Chang and Fei Huang and Reynold Cheng and Yongbin Li},
journal= {arXiv preprint arXiv:2305.03111},
year = {2023}
}
备注
NeurIPS 2023