中文

SParC:上下文中的跨领域语义解析数据集

计算与语言 2019-06-07 v1 人工智能

摘要

我们提出 SParC,一个用于上下文中跨领域语义解析的数据集,包含 4,298 条连贯的问题序列(12k+ 条带有 SQL 查询标注的独立问题)。该数据集来源于 200 个复杂数据库在 138 个领域上的受控用户交互。我们对 SParC 进行了深入分析,表明与现有数据集相比它引入了新挑战。SParC 表现出复杂的上下文依赖关系,(2)具有更大的语义多样性,以及(3)由于其跨领域特性及测试时未见过的数据库,需要对未见领域进行泛化。我们使用两种适配于上下文依赖、跨领域设置的最先进文本到 SQL(text-to-SQL)模型进行实验。最佳模型在所有问题上的精确匹配准确率为 20.2%,在所有交互序列上低于 10%,表明该数据集的跨领域设置与上下文现象为未来研究带来了显著挑战。数据集、基线与排行榜发布于 https://yale-lily.github.io/sparc。

关键词

引用

@article{arxiv.1906.02285,
  title  = {SParC: Cross-Domain Semantic Parsing in Context},
  author = {Tao Yu and Rui Zhang and Michihiro Yasunaga and Yi Chern Tan and Xi Victoria Lin and Suyi Li and Heyang Er and Irene Li and Bo Pang and Tao Chen and Emily Ji and Shreya Dixit and David Proctor and Sungrok Shim and Jonathan Kraft and Vincent Zhang and Caiming Xiong and Richard Socher and Dragomir Radev},
  journal= {arXiv preprint arXiv:1906.02285},
  year   = {2019}
}

备注

Accepted to ACL 2019, long paper