生产环境中 Text-to-SQL 系统 SQL 准确率的智能体无关评估
人工智能
2026-05-01 v1
摘要
生产环境中的 Text-to-SQL(T2SQL)评估面临着现有基准测试无法解决的根本性挑战。当前的评估方法,无论是基于规则的 SQL 匹配还是依赖模式的语义解析器,都假设可以访问真实查询和结构化的数据库模式,而这些约束在实际部署中很少得到满足。这种脱节导致生产环境中的 T2SQL 智能体在开发者测试阶段之后基本无法得到评估,从而造成质量无声下降,且缺乏持续改进的反馈机制。我们提出了 STEF(模式无关的 Text-to-SQL 评估框架),这是一个原生生产评估系统,仅基于自然语言输入(用户问题、增强重述和生成的 SQL)运行,无需数据库模式或参考查询。STEF 从自然语言和 SQL 表示中提取语义规范,执行归一化特征对齐,并通过一个包含过滤对齐、语义判定和评估器置信度的复合指标,生成一个可解释的 0 到 100 的准确率分数。主要贡献包括:将增强问题质量验证作为一等评估信号、通过提示模板注入可配置的特定应用规则,以及处理 GROUP BY 容差、ORDER BY 默认值和 LIMIT 启发式规则的生产环境鲁棒归一化。实证结果表明,STEF 能够在不依赖模式的情况下实现持续的生产监控和智能体改进反馈循环,首次使结构化查询评估在大规模下变得可行。
引用
@article{arxiv.2604.28049,
title = {Agent-Agnostic Evaluation of SQL Accuracy in Production Text-to-SQL Systems},
author = {Taslim Jamal Arif and Kuldeep Singh},
journal= {arXiv preprint arXiv:2604.28049},
year = {2026}
}