中文

用于变分对话建模的分层隐结构

计算与语言 2018-04-13 v2 人工智能 机器学习

摘要

变分自编码器(VAE)与分层 RNN 相结合已成为对话建模的一种强大框架。然而,它们饱受臭名昭著的退化问题之苦,即解码器学会忽略隐变量而退化为普通 RNN。我们通过实验表明,这种退化主要源于两个原因。首先,分层 RNN 解码器的表达能力往往足够高,仅利用其解码分布即可对数据建模而无需依赖隐变量。其次,以上下文为条件的条件 VAE 结构使其生成过程受限于上下文,导致训练目标的范围极为稀疏;也就是说,RNN 解码器可轻易过拟合训练数据而忽略隐变量。为解决退化问题,我们提出一种名为变分分层对话 RNN(VHCR)的新模型,包含两项关键思路:(1) 使用分层隐变量结构,以及 (2) 利用语句丢弃正则化。在 Cornell Movie Dialog 与 Ubuntu Dialog Corpus 两个数据集上的评估表明,我们的 VHCR 成功利用了隐变量,并在对话生成上优于最先进模型。此外,得益于其分层隐结构,它还能执行若干新的语句控制任务。

关键词

引用

@article{arxiv.1804.03424,
  title  = {A Hierarchical Latent Structure for Variational Conversation Modeling},
  author = {Yookoon Park and Jaemin Cho and Gunhee Kim},
  journal= {arXiv preprint arXiv:1804.03424},
  year   = {2018}
}

备注

Published in NAACL 2018 (Oral)