中文

CrossWOZ:一个大规模中文跨领域任务型对话数据集

计算与语言 2020-03-02 v2

摘要

为推动多领域(跨领域)对话建模并缓解中文任务型数据集的短缺,我们提出了 CrossWOZ,首个大规模中文跨领域 Wizard-of-Oz 任务型数据集。它包含 6K 个对话会话和 102K 条语句,涵盖酒店、餐厅、景点、地铁和出租车 5 个领域。此外,该语料库富含用户与系统两侧的对话状态和对话行为标注。约 60% 的对话具有跨领域用户目标,倾向于领域间依赖并鼓励对话中自然的领域过渡。我们还提供了一个用户模拟器以及若干用于流水线任务型对话系统的基准模型,便于研究者在该语料上比较和评估其模型。CrossWOZ 的大规模与丰富标注使其适用于研究跨领域对话建模中的多种任务,如对话状态跟踪、策略学习、用户模拟等。

关键词

引用

@article{arxiv.2002.11893,
  title  = {CrossWOZ: A Large-Scale Chinese Cross-Domain Task-Oriented Dialogue Dataset},
  author = {Qi Zhu and Kaili Huang and Zheng Zhang and Xiaoyan Zhu and Minlie Huang},
  journal= {arXiv preprint arXiv:2002.11893},
  year   = {2020}
}

备注

Accepted by TACL