中文

超越 Text-to-SQL:LLM 真能调试企业级 ETL SQL 吗?

人工智能 2026-01-27 v1

摘要

SQL 是企业数据工程的核心,但即使对于经验丰富的开发者和先进的 text-to-SQL LLM 而言,在单次尝试中生成完全正确的 SQL 代码仍然困难,通常需要多次调试迭代。我们引入了 OurBench,这是首个面向企业级 SQL 推理与调试的基准测试。我们的基准测试基于两项关键创新构建:(1)一个自动化构建工作流,使用逆向工程系统地将真实错误注入大规模 SQL 代码中,实现可扩展且多样化的基准生成;(2)一个专为企业环境定制的免执行评估框架,提供快速、准确且资源高效的评估。OurBench 包含 469 个 OurBenchSyn 查询(具有语法错误和明确的错误信息)以及 516 个 OurBenchSem 查询(针对代码未能满足用户意图的语义错误)。这些查询高度复杂,平均超过 140 行,并具有深且宽的抽象语法树。对近 30 个 LLM 的评估揭示了巨大的性能差距:表现最好的模型 Claude-4-Sonnet 在 OurBenchSyn 上的准确率仅为 36.46%,在 OurBenchSem 上为 32.17%,而大多数模型的得分低于 20%。我们进一步探索了四种解决方案策略,识别了关键挑战,并概述了利用 LLM 进行企业级 SQL 调试的富有前景的方向。

关键词

引用

@article{arxiv.2601.18119,
  title  = {Beyond Text-to-SQL: Can LLMs Really Debug Enterprise ETL SQL?},
  author = {Jing Ye and Yiwen Duan and Yonghong Yu and Victor Ma and Yang Gao and Xing Chen},
  journal= {arXiv preprint arXiv:2601.18119},
  year   = {2026}
}