Sigma:用于带统计分析的文本到代码语义解析的数据集
机器学习
2025-04-08 v1 人工智能
数据库
摘要
在语义解析领域,Text-to-SQL 和问答任务已取得显著进展,这两者都专注于从数据源的原始格式中提取信息。然而,这些形式化语义表示(如 SQL 编程语言或基本逻辑形式)固有的限制,阻碍了其从多种角度分析数据的能力,例如进行统计分析。为此,我们设计了 SIGMA,这是一个用于带统计分析的文本到代码语义解析的数据集。SIGMA 包含 6000 个问题及其对应的 Python 代码标签,涵及 160 个数据库。一半的问题涉及查询类型,这类问题以其原始格式返回信息,而剩余的 50% 为统计分析问题,对数据执行统计操作。我们数据集中的 Python 代码标签覆盖 4 种查询类型和 40 种统计分析模式。我们使用三种不同的基线模型评估了 SIGMA 数据集:LGESQL、SmBoP 和 SLSQL。实验结果表明,采用 ELECTRA 的 LGESQL 模型在所有模型中表现最佳,达到 83.37% 的结构准确率。在执行准确率方面,结合 GraPPa 和 T5 的 SmBoP 模型达到了 76.38%。
引用
@article{arxiv.2504.04301,
title = {Sigma: A dataset for text-to-code semantic parsing with statistical analysis},
author = {Saleh Almohaimeed and Shenyang Liu and May Alsofyani and Saad Almohaimeed and Liqiang Wang},
journal= {arXiv preprint arXiv:2504.04301},
year = {2025}
}
备注
2023 International Conference on Machine Learning and Applications (ICMLA) This version includes more details than the conference version