文本到 SQL 中推理与非推理大型语言模型的成本权衡
数据库
2026-03-10 v2 人工智能
分布式、并行与集群计算
摘要
虽然文本到 SQL 系统取得了高准确率,但现有效率指标如 Valid Efficiency Score 优先考虑执行时间,而我们指出该指标本质上与基于消费的云端计费脱节。本文通过在 Google BigQuery 上对 180 项文本到 SQL 查询执行进行评估,使用 230 GB 的 StackOverflow 数据集,对比评估了推理与非推理大型语言模型之间的云查询执行成本权衡。我们的分析表明,推理模型比非推理模型处理的字节数少 44.5%,在准确性上保持 96.7% 到 100% 的相当水平,且执行时间与查询成本的相关性很弱(),表明速度优化不等同于成本效益。非推理模型也表现出最高可达 3.4 倍的极端成本波动,产生的异常查询每项超过 36 GB,超过最佳模型 20 倍的平均 1.8 GB,由于缺失分区过滤器和低效联接导致。我们识别了这些普遍的低效模式,并提供部署指南以缓解成本敏感型企业环境中的财务风险。
引用
@article{arxiv.2512.22364,
title = {Cost Trade-offs of Reasoning and Non-Reasoning Large Language Models in Text-to-SQL},
author = {Saurabh Deochake and Debajyoti Mukhopadhyay},
journal= {arXiv preprint arXiv:2512.22364},
year = {2026}
}