Agent Bain vs. Agent McKinsey:面向商业域的文本到 SQL 基准
计算与语言
2026-01-15 v4
摘要
文本到 SQL 基准传统上只测试简单的数据访问,将自然语言转换为 SQL 查询的翻译任务。但实际情况下,用户倾向于提出需要更复杂响应的提问,包括数据驱动的预测或建议。以商业域为 motivating 案例,我们引入 CORGI,一个新的基准,将文本到 SQL 扩展到反映终端用户实际遇到的实际数据库查询。CORGI 由受 DoorDash、Airbnb 和 Lululemon 等企业启发的合成数据库组成。它提供了跨四个日益复杂的商业查询类别的提问:描述性、解释性、预测性和建议性。这一挑战需要因果推理、时序预测和战略建议,反映了多层次和多步骤的 agentic 智能。我们发现 LLM 在问题复杂度提升后在更高层次问题上的表现下降。CORGI 还引入并鼓励文本到 SQL 社区考虑新的自动方法,以评估数据访问任务中开放式、定性响应的质量。我们的实验表明,LLM 在 CORGI 上的平均成功执行率(SER)比现有基准如 BIRD 低 33.12%,凸显了真实商业需求的显著更高复杂性。我们发布 CORGI 数据集、评估框架以及提交网站,以支持未来研究。
引用
@article{arxiv.2510.07309,
title = {Agent Bain vs. Agent McKinsey: A New Text-to-SQL Benchmark for the Business Domain},
author = {Yue Li and Ran Tao and Derek Hommel and Yusuf Denizay Dönder and Sungyong Chang and David Mimno and Unso Eun Seo Jo},
journal= {arXiv preprint arXiv:2510.07309},
year = {2026}
}
备注
23 pages, under review for ACL ARR