中文

一个用于文档依据对话的数据集

计算与语言 2018-09-21 v1

摘要

本文介绍了一个用于文本对话的文档依据数据集。我们将“文档依据对话”定义为关于指定文档内容的对话。在该数据集中,指定文档是关于热门电影的维基百科文章。该数据集包含4112段对话,平均每段对话21.43轮。这使得该数据集不仅能在生成回复时提供相关的聊天历史,还能提供模型可使用的信息来源。我们描述了两种提供生成下一回复任务基准性能的神经架构。我们还评估了我们的模型在参与度和流畅性方面的表现,发现来自文档的信息有助于生成更具参与度和流畅性的回复。

关键词

引用

@article{arxiv.1809.07358,
  title  = {A Dataset for Document Grounded Conversations},
  author = {Kangyan Zhou and Shrimai Prabhumoye and Alan W Black},
  journal= {arXiv preprint arXiv:1809.07358},
  year   = {2018}
}