使用带高斯混合先验的 Wasserstein 自编码器进行风格化文本生成
计算与语言
2019-11-12 v1
摘要
Wasserstein 自编码器对文本生成十分有效。然而,若数据集具有多个类别且包含不同主题,它们无法对生成句子的风格与主题提供任何控制。本工作中,我们提出一种用于生成风格化句子的半监督方法。我们的模型在多类别数据集上训练,并使用高斯混合先验学习句子的潜表示,且无需任何对抗损失。这使我们能够通过从指定类别或多个类别的对应先验分布中采样,生成这些类别风格的句子。此外,我们能在相对较小的数据集上训练模型,并通过向数据集中加入具有其他风格/类别的外部数据来学习指定类别的潜表示。虽然简单的 WAE 或 VAE 在此情况下无法生成多样化句子,但我们方法生成的句子具有多样性、流畅性,并保留所需类别的风格与内容。
引用
@article{arxiv.1911.03828,
title = {Stylized Text Generation Using Wasserstein Autoencoders with a Mixture of Gaussian Prior},
author = {Amirpasha Ghabussi and Lili Mou and Olga Vechtomova},
journal= {arXiv preprint arXiv:1911.03828},
year = {2019}
}