中文

Taskmaster-1:迈向真实且多样的对话数据集

计算与语言 2019-09-13 v1 人工智能 机器学习

摘要

数据驱动方法构建对话系统的一大障碍是缺乏高质量、面向目标的对话数据。为满足这一基本需求,我们推出 Taskmaster-1 数据集的首次发布版本,包含 13,215 段基于任务的对话,涵盖六个领域。我们采用两种流程创建该集合,各自具有独特优势。第一种是双人、口语化的“绿野仙踪”(WOz)方法,由受过训练的代理与众包工作者交互完成任务;第二种是“自对话”,由众包工作者自行撰写整段对话。我们不将工作者限制于详细脚本或小型知识库,因此观察到与现有数据集相比,我们的数据集包含更真实且多样的对话。我们提供若干基线模型,包括具有基准性能的最先进神经 seq2seq 架构以及定性人工评估。对话标注了 API 调用与参数,这是一种简单且经济高效的方法,避免了复杂标注模式的需求。对话模型与服务提供者 API 之间的抽象层允许给定模型与提供相似功能的多个服务交互。最后,该数据集将引发对书面语与口语、话语模式、错误处理及与对话系统研究、开发和设计相关的其他语言现象的兴趣。

关键词

引用

@article{arxiv.1909.05358,
  title  = {Taskmaster-1: Toward a Realistic and Diverse Dialog Dataset},
  author = {Bill Byrne and Karthik Krishnamoorthi and Chinnadhurai Sankar and Arvind Neelakantan and Daniel Duckworth and Semih Yavuz and Ben Goodrich and Amit Dubey and Andy Cedilnik and Kyu-Young Kim},
  journal= {arXiv preprint arXiv:1909.05358},
  year   = {2019}
}

备注

To appear at EMNLP 2019