中文

DialogStudio:面向对话式 AI 最丰富且最多样的统一数据集集合

计算与语言 2024-02-06 v3 人工智能

摘要

尽管对话式 AI 取得了进展,语言模型仍面临处理多样化对话任务的挑战,且现有对话数据集集合常缺乏多样性与全面性。为应对这些问题,我们引入 DialogStudio:最大且最多样的对话数据集集合,在统一一致格式下保留原始信息。我们的集合涵盖开放域对话、任务导向对话、自然语言理解、对话式推荐、对话摘要以及知识 grounded 对话数据,使其成为对话研究与模型训练极为丰富且多样的资源。为进一步提升 DialogStudio 的效用,我们为各数据集确认许可证,并为选定对话设计外部知识与领域感知提示,以促进指令感知微调。此外,我们利用该数据集集合开发了对话式 AI 模型,并在零样本与少样本学习场景中的实验证明了 DialogStudio 的优越性。为提升透明度并支持数据集与基于任务的研究以及语言模型预训练,与 DialogStudio 相关的所有数据集、许可证、代码与模型均公开可获取\footnote{\url{https://github.com/salesforce/DialogStudio}}。

关键词

引用

@article{arxiv.2307.10172,
  title  = {DialogStudio: Towards Richest and Most Diverse Unified Dataset Collection for Conversational AI},
  author = {Jianguo Zhang and Kun Qian and Zhiwei Liu and Shelby Heinecke and Rui Meng and Ye Liu and Zhou Yu and Huan Wang and Silvio Savarese and Caiming Xiong},
  journal= {arXiv preprint arXiv:2307.10172},
  year   = {2024}
}

备注

17 pages, accepted by EACL 2024 Findings as a long paper. All datasets, licenses, codes, and models are available at at https://github.com/salesforce/DialogStudio