Falcon:面向企业级评估的综合中文文本转 SQL 基准
计算与语言
2025-10-30 v1 人工智能
摘要
我们介绍了 Falcon,这是一个基于企业兼容方言(MaxCompute/Hive)的中文文本转 SQL 基准测试集。其包含 600 条中文问题,涉及 28 个数据库;77% 的问题需要多表推理,且超过半数涉及超过四张表。每条示例均标注了 SQL 计算特征和中文语义。对于评估,我们发布了健壮的执行比较器和自动化评估管道,在此框架下,当前所有主流大规模模型(包括 Deepseek)的最高准确率仅为 50%。主要错误来源于两个方面:(1) 大规模企业场景中的模式链接——大量表格、反规范化字段、模糊列名、隐式外键关系以及领域特定同义词,使正确的联接/列选择困难;(2) 将简洁口语化中文映射到分析所需的精确运算符和谓词——例如选择正确的聚合和分组键、表达时间窗口和粒度、应用单位转换、处理 NULL 值和数据质量规则,以及构建嵌套或窗口子查询。Falcon 因此针对中文特定语义和企业方言(缩写、业务术语、模糊实体引用),提供了可复现的中间方案,以实际的企业模式、查询模板、执行比较器和自动化评估管道,实现端到端验证,为最终的生产部署奠定基础。
引用
@article{arxiv.2510.24762,
title = {Falcon: A Comprehensive Chinese Text-to-SQL Benchmark for Enterprise-Grade Evaluation},
author = {Wenzhen Luo and Wei Guan and Yifan Yao and Yimin Pan and Feng Wang and Zhipeng Yu and Zhe Wen and Liang Chen and Yihong Zhuang},
journal= {arXiv preprint arXiv:2510.24762},
year = {2025}
}