中文

具有多样化特征的个性化对话生成

计算与语言 2020-01-03 v2

摘要

赋予对话系统特定人格特征对于实现更拟人化的交谈至关重要。然而,由于通过语言表达体现人格的挑战以及缺乏大规模人格标注对话数据,该研究方向仍远未被充分研究。本文中,我们探究在对话生成中融入显式人格特征以产出个性化对话的问题。为此,首先,我们构建 PersonalDialog,一个来自大量说话人、包含多种特征的大规模多轮对话数据集。该数据集由来自 8.47M 说话人的 20.83M 会话与 56.25M 语句组成。每句话语关联一个标有年龄、性别、位置、兴趣标签等特征的说话人。我们设计了若干匿名化方案以保护各说话人隐私。该大规模数据集不仅将促进个性化对话生成研究,也将助益社会语言学或社会科学的其他研究。其次,为研究人格特征如何在对话生成中被捕获与处理,我们在序列到序列学习框架内提出感知人格的对话生成模型。显式人格特征(以键值对结构化)经特征融合模块嵌入。在解码过程中,设计两种技术,即人格感知注意力与人格感知偏置,以捕获并处理特征相关信息。实验表明,我们的模型能在不同语境中妥善处理恰当特征。案例研究也展示了这一挑战性研究问题的有趣结果。

关键词

引用

@article{arxiv.1901.09672,
  title  = {Personalized Dialogue Generation with Diversified Traits},
  author = {Yinhe Zheng and Guanyi Chen and Minlie Huang and Song Liu and Xuan Zhu},
  journal= {arXiv preprint arXiv:1901.09672},
  year   = {2020}
}

备注

Please contact [zhengyinhe1 at 163 dot com] for the PersonalDialog dataset