中文

面向可靠 LLM 驱动数据分析的语义层:三款前沿模型准确率与幻觉的配对基准测试

人工智能 2026-04-29 v1

摘要

部署用于自然语言查询分析数据库的 LLM 面临两类交织而存的故障——错误答案和自信幻觉,两者都根植于同一根本原因:模型被迫推断出模式图表中未编码的业务语义。我们测试了是否通过提供这些语义来缩小差距。我们对三款前沿 LLM(Claude Opus 4.7、Claude Sonnet 4.6、GPT-5.4)在 ClickHouse 上的 Cleaned Contoso 零售数据集上进行 100 个自然语言问题的基准测试,采用配对单次测评协议。每个模型都被评估两次:一次仅给定仓库模式,另一次给定模式加上一份 4 KB 人工编写的 markdown 文档,描述数据集的度量、惯例及消歧规则。加入该文档后,所有三款模型的准确率提升 17-23 个百分点。在有该文档时,三款模型在统计上不可区分(67.7-68.7%);在没有该文档时,同样不可区分(45.5-50.5%)。所有跨聚类比较在 p < 0.01 时均具有显著性;语义层文档的存在解释了几乎所有显著方差;模型在同一档次中的选择并不影响结果。我们将此解释为一种结构性结果:显式的业务语义并非通过提升模型能力来抑制文本到 SQL 错误的主要类别,而是通过改变模型被要求执行的任务来实现。

关键词

引用

@article{arxiv.2604.25149,
  title  = {Semantic Layers for Reliable LLM-Powered Data Analytics: A Paired Benchmark of Accuracy and Hallucination Across Three Frontier Models},
  author = {Michael Rumiantsau and Ivan Fokeev},
  journal= {arXiv preprint arXiv:2604.25149},
  year   = {2026}
}