基于Exaone 3.5的文本到SQL生成事实一致性评估——面向商业智能
计算与语言
2025-05-02 v1 人工智能
机器学习
摘要
大语言模型(LLM)在通过文本到SQL生成实现自然语言结构数据查询方面显示出前景,但其在现实商业智能(BI)场景中的应用仍受限,主要due to语义幻觉、结构错误以及缺乏领域特定评估框架。本研究提出一种用于评估LLM生成SQL输出语义准确性的事实一致性评估框架,基于Exaone 3.5——一个针对企业任务优化的指令调优型双语大语言模型。我们构建了一个由219个自然语言商业问题构成的领域特定基准,这些问题分为五个SQL复杂度等级,源自LG Electronics内部BigQuery环境中的实际销售数据。每个问题都配有金标准SQL查询和验证的ground-truth答案。我们使用答案准确率、执行成功率、语义错误率和非响应率评估模型性能。实验结果表明,Exaone 3.5在简单聚合任务上表现良好(L1为93%准确率),但在算术推理(H1为4%准确率)和分组排序任务(H4为31%)中表现显著下降,语义错误和非响应集中在复杂案例中。定性错误分析进一步识别了诸如误应用算术逻辑、过滤不完整和错误分组操作等常见失败类型。我们的发现凸显了LLM在业务关键环境中的当前局限性,强调需要事实一致性验证层和混合推理方法。本工作贡献了一个可复现的基准和评估方法,推动可靠的自然语言接口向结构化企业数据系统发展。
关键词
引用
@article{arxiv.2505.00060,
title = {Fact-Consistency Evaluation of Text-to-SQL Generation for Business Intelligence Using Exaone 3.5},
author = {Jeho Choi},
journal= {arXiv preprint arXiv:2505.00060},
year = {2025}
}
备注
6 pages, 1 table