中文

KdConv:一个面向多轮知识驱动对话的中文多领域对话数据集

计算与语言 2020-04-09 v1 人工智能

摘要

由于缺少由多主题、带知识标注的多轮对话构成的对话数据,知识驱动对话系统的研究受到很大限制。本文提出一个中文多领域知识驱动对话数据集 KdConv,其将多轮对话中的主题锚定于知识图谱。我们的语料包含来自三个领域(电影、音乐与旅游)的 4.5K 段对话,以及 86K 条语句,平均轮数为 19.0。这些对话包含对相关主题的深入讨论以及多主题间的自然过渡。为便利后续基于该语料的研究,我们提供了若干基准模型。对比结果表明,引入背景知识可增强模型,但在利用知识对多轮对话建模方面仍有很大探索空间。结果还显示不同领域间存在明显性能差异,表明值得进一步探索迁移学习与领域自适应。该语料与基准模型已公开可用。

关键词

引用

@article{arxiv.2004.04100,
  title  = {KdConv: A Chinese Multi-domain Dialogue Dataset Towards Multi-turn Knowledge-driven Conversation},
  author = {Hao Zhou and Chujie Zheng and Kaili Huang and Minlie Huang and Xiaoyan Zhu},
  journal= {arXiv preprint arXiv:2004.04100},
  year   = {2020}
}