中文

CPED:面向对话式 AI 的大规模中文个性化与情感对话数据集

计算与语言 2022-05-31 v1 人工智能 人机交互 多媒体

摘要

人类语言表达基于对话境的主观建构而非客观真值条件,这意味着说话者在认知加工后的个性与情绪对对话有重要影响。然而,现有大多数面向对话式 AI 的数据集忽略了人的个性与情绪,或仅考虑其中部分。尽管大规模预训练语言模型已被广泛使用,对话系统仍难以理解说话者的个性与情绪。为在对话生成过程中同时考虑个性与情绪,我们提出 CPED,一个大规模中文个性化与情感对话数据集,其包含与同理心和个人特征相关的多源知识。这些知识涵盖性别、大五人格特质、13 种情绪、19 种对话行为和 10 种场景。CPED 包含来自 40 部电视剧的 392 个说话者的超过 12K 轮对话。我们根据版权声明、隐私问题及视频平台服务条款发布了带有音频特征与视频特征的文本数据集。我们提供了 CPED 构建过程的详细描述,并介绍了对话式 AI 的三项任务,包括个性识别、对话中的情绪识别以及个性化与情感对话生成。最后,我们为这些任务提供了基线系统,并探讨了说话者个性与情绪对对话的作用。我们的动机是提出一个被 NLP 社区广泛采用、作为对话式 AI 研究新开放基准的数据集。完整数据集可在 https://github.com/scutcyr/CPED 获取。

关键词

引用

@article{arxiv.2205.14727,
  title  = {CPED: A Large-Scale Chinese Personalized and Emotional Dialogue Dataset for Conversational AI},
  author = {Yirong Chen and Weiquan Fan and Xiaofen Xing and Jianxin Pang and Minlie Huang and Wenjing Han and Qianfeng Tie and Xiangmin Xu},
  journal= {arXiv preprint arXiv:2205.14727},
  year   = {2022}
}