中文

nvBench:面向跨领域自然语言到可视化任务的大规模合成数据集

人机交互 2021-12-28 v1 人工智能

摘要

NL2VIS——即将自然语言(NL)查询转换为相应可视化(VIS)——已在商业可视化供应商与学术研究者中引起越来越多的关注。过去几年中,基于深度学习的先进模型在许多自然语言处理(NLP)任务中取得了类人能力,这清楚地表明基于深度学习的技术是推动 NL2VIS 领域的良好选择。然而,一大障碍是缺乏包含大量(NL, VIS)对的基准。我们提出 nvBench,首个大规模 NL2VIS 基准,包含来自 105 个领域 750 张表的 25,750 个(NL, VIS)对,由(NL, SQL)基准合成而来以支持跨领域 NL2VIS 任务。nvBench 的质量已由 23 位专家与 300 多名众包工作者广泛验证。使用 nvBench 训练的基于深度学习的模型表明,nvBench 能够推动 NL2VIS 领域的发展。

关键词

引用

@article{arxiv.2112.12926,
  title  = {nvBench: A Large-Scale Synthesized Dataset for Cross-Domain Natural Language to Visualization Task},
  author = {Yuyu Luo and Jiawei Tang and Guoliang Li},
  journal= {arXiv preprint arXiv:2112.12926},
  year   = {2021}
}