通过自标注条件变分自编码器改进多样化文本生成
机器学习
2019-03-27 v1 计算与语言
机器学习
摘要
多样性在许多文本生成应用中起着至关重要的作用。近年来,条件变分自编码器(CVAE)在此任务上展现出有前景的性能。然而,它们常遇到所谓的 KL 消失问题。先前工作通过启发式方法缓解该问题,例如在优化 CVAE 目标函数时增强编码器或削弱解码器。尽管如此,这些方法的优化方向是隐式的,且难以找到应用这些方法的适当程度。本文中,我们提出一个显式优化目标来补充 CVAE 以直接远离 KL 消失。实际上,该目标项引导编码器朝向解码器的“最佳编码器”以提升表达能力。引入一个标注网络来估计“最佳编码器”。它在 CVAE 的潜空间中提供连续标签,以帮助建立潜变量与目标之间的紧密关联。整个提出的方法命名为自标注 CVAE(SLCVAE)。为加速多样化文本生成的研究,我们还提出了一个大型原生一对多数据集。在两个任务上进行了大量实验,表明我们的方法在取得与最先进算法可比准确率的同时,大幅提升了生成多样性。
引用
@article{arxiv.1903.10842,
title = {Improve Diverse Text Generation by Self Labeling Conditional Variational Auto Encoder},
author = {Yuchi Zhang and Yongliang Wang and Liping Zhang and Zhiqiang Zhang and Kun Gai},
journal= {arXiv preprint arXiv:1903.10842},
year = {2019}
}
备注
Accepted as a conference paper in ICASSP 2019. But this copy is an extended version of the submitted manuscript. With more theoretical analysis and human evaluation