中文

PIPPA:一个部分合成对话数据集

计算与语言 2023-08-14 v1

摘要

随着日益强大的大语言模型的出现,人们越来越有兴趣利用这些模型进行闲聊对话和角色扮演应用。然而,现有的对话和角色扮演数据集往往无法捕捉真实世界角色扮演参与者所表现出的多样且细腻的互动。为解决这一局限并助力这一快速发展的领域,我们引入了一个名为 PIPPA(人与 AI 之间的个人互动对)的部分合成数据集。PIPPA 是一项由一群角色扮演爱好者参与的社区驱动众包努力的成果。该数据集包含超过 100 万条话语,分布在 26000 个对话会话中,为研究人员和 AI 开发人员在角色扮演场景下探索和 refinement 对话 AI 系统提供了丰富的资源。

关键词

引用

@article{arxiv.2308.05884,
  title  = {PIPPA: A Partially Synthetic Conversational Dataset},
  author = {Tear Gosling and Alpin Dale and Yinhe Zheng},
  journal= {arXiv preprint arXiv:2308.05884},
  year   = {2023}
}

备注

13 pages, 5 figures