中文

E2E数据集:端到端生成的新挑战

计算与语言 2017-09-18 v2

摘要

本文描述了E2E数据,一个用于在餐厅领域训练端到端、数据驱动的自然语言生成系统的新数据集,其规模是此领域现有常用数据集的十倍。E2E数据集带来了新的挑战:(1)其人类参考文本展现出更丰富的词汇多样性和句法变化,包括语篇现象;(2)从该集合生成需要内容选择。因此,从该数据集学习有望产生更自然、更多变且更少模板化的系统话语。我们还在该数据集上建立了一个基线,说明了与此数据相关的一些困难。

关键词

引用

@article{arxiv.1706.09254,
  title  = {The E2E Dataset: New Challenges For End-to-End Generation},
  author = {Jekaterina Novikova and Ondřej Dušek and Verena Rieser},
  journal= {arXiv preprint arXiv:1706.09254},
  year   = {2017}
}

备注

Accepted as a short paper for SIGDIAL 2017 (final submission including supplementary material)