中文

JDDC 语料库:面向电商客服的大规模多轮中文对话数据集

计算与语言 2020-03-25 v4 人工智能 信息检索

摘要

人类对话十分复杂,构建类人对话智能体是一项极具挑战的任务。随着深度学习技术的快速发展,数据驱动模型日益普遍,其需要海量真实对话数据。本文构建了一个大规模真实场景中文电商对话语料库 JDDC,包含超过 100 万轮多轮对话、2000 万条语句和 1.5 亿词。该数据集反映了人机对话的若干特征,例如目标驱动以及上下文间的长期依赖。它还涵盖多种对话类型,包括任务导向、闲聊和问答。我们还提供了额外的意图信息以及三个精心标注的挑战集。随后,我们评估了若干检索式与生成式模型,以在 JDDC 语料库上提供基础基准性能。我们希望 JDDC 能作为一个有效的测试平台,并裨益于对话任务的基础研究。

关键词

引用

@article{arxiv.1911.09969,
  title  = {The JDDC Corpus: A Large-Scale Multi-Turn Chinese Dialogue Dataset for E-commerce Customer Service},
  author = {Meng Chen and Ruixue Liu and Lei Shen and Shaozu Yuan and Jingyan Zhou and Youzheng Wu and Xiaodong He and Bowen Zhou},
  journal= {arXiv preprint arXiv:1911.09969},
  year   = {2020}
}

备注

This paper is accepted by LREC 2020 (International Conference on Language Resources and Evaluation )