真实场景下的文本到SQL:基于Stack Exchange数据的自然发生数据集
计算与语言
2021-06-10 v1
摘要
大多数可用的语义解析数据集由自然语言话语与逻辑形式对组成,仅为训练和评估自然语言理解系统而收集。因此,它们不包含自然发生话语的丰富性与多样性,即人类询问其所需或好奇的数据时的表达。在本工作中,我们发布SEDE,一个包含从Stack Exchange网站真实使用中提取的12,023对话语与SQL查询的数据集。我们表明这些配对包含多种现实世界挑战,这些挑战在以往任何其他语义解析数据集中都很少被反映;提出一种基于部分查询子句比较的评估指标,更适用于现实世界查询;并使用强基线进行实验,显示出SEDE上与其他常见数据集相比存在巨大性能差距。
引用
@article{arxiv.2106.05006,
title = {Text-to-SQL in the Wild: A Naturally-Occurring Dataset Based on Stack Exchange Data},
author = {Moshe Hazoom and Vibhor Malik and Ben Bogin},
journal= {arXiv preprint arXiv:2106.05006},
year = {2021}
}
备注
NLP4Prog 2021