中文

面向自动化文本到 SQL 生成的代理、计划与管道基准测试 BAPPA

计算与语言 2025-11-07 v1 人工智能 数据库 多智能体系统

摘要

文本到 SQL 系统提供了自然语言接口,可使即使是非技术用户也能访问存储在数据库中的信息。然而,现有的大型语言模型 (LLM) 在从自然指令生成 SQL 时难以应对大型模式和复杂推理。先前的工作通常关注使用旗舰模型的复杂且有些不切实际的管道,而小型高效模型则被忽视了。本文探索了三个多智能体 LLM 管道,并在从小到大的开源模型范围内进行系统的性能基准测试:(1) 多智能体讨论管道,其中智能体不断批判和细化 SQL 查询,评判者综合最终答案;(2) 计划-编码管道,其中思考模型计划师生成分步骤的 SQL 生成计划,编码师综合查询;(3) 编码-聚合管道,其中多个编码师独立生成 SQL 查询,推理智能体选择最佳查询。在 Bird-Bench Mini-Dev 集合上的实验表明,多智能体讨论可提升小型模型性能,Qwen2.5-7b-Instruct 在进行三轮讨论后看似提升了 10.6% 的执行准确率。对于管道而言,LLM Reasoner-Coder 管道取得了最佳结果,DeepSeek-R1-32B 和 QwQ-32B 计划师将 Gemma 3 27B IT 的准确率从 52.4% 提升至最高 56.4%。代码已在 https://github.com/treeDweller98/bappa-sql 提供。

关键词

引用

@article{arxiv.2511.04153,
  title  = {BAPPA: Benchmarking Agents, Plans, and Pipelines for Automated Text-to-SQL Generation},
  author = {Fahim Ahmed and Md Mubtasim Ahasan and Jahir Sadik Monon and Muntasir Wahed and M Ashraful Amin and A K M Mahbubur Rahman and Amin Ahsan Ali},
  journal= {arXiv preprint arXiv:2511.04153},
  year   = {2025}
}