BenchPress:用于快速文本到SQL基准制定的人类在环注释系统
计算与语言
2026-02-03 v2 人工智能
数据库
人机交互
摘要
大语言模型(LLM)已成功应用于众多任务,包括文本到SQL生成。然而,这些工作大多聚焦于公开数据集,如Fiben、Spider和Bird。我们之前的工作表明,LLM在查询大型私有企业数据仓库方面效果较差,首次发布了Beaver——针对私有企业文本到SQL基准的数据集。为创建Beaver,我们利用SQL日志,这些日志往往易于获取。然而,对这些日志进行手动注释以识别其对应的自然语言问题则是一项艰巨的任务。要求数据库管理员——高度专业的专家——承担额外的工作来构建和验证对应的自然语言语句,不仅具有挑战性,而且成本也相当高。为此,我们引入BenchPress,一个面向加速私有企业文本到SQL基准制定的人类在环系统。给定SQL查询,BenchPress利用检索增强生成(RAG)和LLM提出多个自然语言描述。人类专家随后选择、排序或编辑这些草稿,以确保准确性和领域对齐。我们在标注好的企业SQL日志上进行评估,结果表明LLM辅助的注释显著减少了创建高质量基准所需的时间和精力。我们的实验结果表明,结合人类验证与LLM生成建议,能提升注释准确性、基准可靠性和模型评估稳健性。通过简化自定义基准的创建过程,BenchPress为研究人员和实践者提供了评估特定领域工作负载下文本到SQL模型性能的手段。BenchPress已通过我们的公开GitHub仓库(https://github.com/fabian-wenz/enterprise-txt2sql)提供,并在我们的网站(http://dsg-mcgraw.csail.mit.edu:5000)上也可访问。
引用
@article{arxiv.2510.13853,
title = {BenchPress: A Human-in-the-Loop Annotation System for Rapid Text-to-SQL Benchmark Curation},
author = {Fabian Wenz and Omar Bouattour and Devin Yang and Justin Choi and Cecil Gregg and Nesime Tatbul and Çağatay Demiralp},
journal= {arXiv preprint arXiv:2510.13853},
year = {2026}
}
备注
CIDR'26