中文

NaturalConv:一个面向多轮主题驱动对话的中文对话数据集

计算与语言 2024-11-08 v3

摘要

在本文中,我们提出了一个中文多轮主题驱动对话数据集 NaturalConv,只要提及主题中的任何元素且主题转换平滑,参与者就可以聊任何他们想聊的内容。我们的语料库包含来自六个领域的 19.9K 段对话,以及 40 万条语句,平均轮数为 20.1。这些对话包含对相关主题的深入讨论,或在多个主题间广泛的自然过渡。我们认为两种方式对于人类对话都是正常的。为促进对该语料库的研究,我们给出了若干基准模型的结果。对比结果表明,对于该数据集,我们当前的模型无法通过引入背景知识/主题带来显著提升。因此,所提出的数据集应可作为进一步研究评估多轮对话系统有效性与自然性的良好基准。我们的数据集可在 https://ailab.tencent.com/ailab/nlp/dialogue/#datasets 获取。

关键词

引用

@article{arxiv.2103.02548,
  title  = {NaturalConv: A Chinese Dialogue Dataset Towards Multi-turn Topic-driven Conversation},
  author = {Xiaoyang Wang and Chen Li and Jianqiao Zhao and Dong Yu},
  journal= {arXiv preprint arXiv:2103.02548},
  year   = {2024}
}

备注

Accepted as a main track paper at AAAI 2021