BEAVER:面向企业的文本到 SQL 基准测试
计算与语言
2026-05-14 v3 人工智能
数据库
摘要
现有的文本到 SQL 基准测试大多来自结构完善、简单问题-SQL 对的公开数据库。虽然大型语言模型(LLM)在这些场景下表现出色,但在复杂的私有企业环境中仍未证明其有效性——这些环境特征为复杂的模式、领域知识以及涉及高级结构和函数的分析性用户查询。为弥合这一差距,我们引入BEAVER,这是第一个来自私有数据仓库的文本到 SQL 基准测试。它包含来自真实查询日志的 9128 个问题-SQL 对,以及 812 张来自 19 个不同领域的表格。构建此基准测试面临两个挑战:(1)企业查询日志因隐私限制而稀缺;(2)基于准确率的全或无评估指标使得诊断错误困难——尤其是当正确生成查询需要解决诸如领域知识和查询复杂度等多个复合挑战时。我们在数据层面上合成高保真、经专家验证的查询,从而扩大数据集规模,同时孤立或组合各个挑战,生成聚焦领域知识、查询复杂度或两者兼顾的查询。在评估层面,我们提供针对五个关键子任务的人类标注和评估指标,以实现细粒度分析。我们的评估显示,与现有基准测试相比,SOTA代理式框架使用先进模型 GPT-5.2 仅实现 10.8% 的准确率。当提供所有子任务标注作为 oracle 提示时,准确率提升至 30.1%,表明正确解决这些子任务是主要瓶颈。最后,我们提供残余错误的分类学,即使有子任务提示,仍存在特定挑战,如使用高级函数。
引用
@article{arxiv.2409.02038,
title = {BEAVER: An Enterprise Benchmark for Text-to-SQL},
author = {Peter Baile Chen and Devin Yang and Weiyue Li and Fabian Wenz and Yi Zhang and Nesime Tatbul and Michael Cafarella and Çağatay Demiralp and Michael Stonebraker},
journal= {arXiv preprint arXiv:2409.02038},
year = {2026}
}
备注
Dataset and code are available at https://beaverbench.github.io/