Pchatbot:一个大规模个性化聊天机器人数据集
计算与语言
2021-06-01 v3 人工智能
摘要
自然语言对话系统近来引起极大关注。由于许多对话模型是数据驱动的,高质量数据集对这些系统至关重要。本文中,我们介绍 Pchatbot,一个大规模对话数据集,包含分别从微博和司法论坛收集的两个子集。为使原始数据集适应对话系统,我们通过匿名化、去重、分词和过滤等过程精心规范化原始数据集。Pchatbot 的规模显著大于现有中文数据集,这可能有益于数据驱动模型。此外,当前用于个性化聊天机器人的对话数据集通常包含若干人物句或属性。与现有数据集不同,Pchatbot 为帖子和回复均提供匿名化用户 ID 与时间戳。这使得能够开发直接从用户对话历史中学习隐式用户个性的个性化对话模型。我们的初步实验研究对若干最先进对话模型进行基准测试,为未来工作提供比较。该数据集可在 Github 公开获取。
引用
@article{arxiv.2009.13284,
title = {Pchatbot: A Large-Scale Dataset for Personalized Chatbot},
author = {Hongjin Qian and Xiaohe Li and Hanxun Zhong and Yu Guo and Yueyuan Ma and Yutao Zhu and Zhanliang Liu and Zhicheng Dou and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2009.13284},
year = {2021}
}
备注
Camera-ready version, SIGIR 2021 (Resource Track), the dataset and codes are available at https://github.com/qhjqhj00/Pchatbot