中文

利用变分自编码器改进不同模态间的双向生成

机器学习 2018-01-29 v1 机器学习

摘要

我们研究能够双向交换多种模态的深度生成模型,例如从相应文本生成图像及反之。实现此目标的主要方法是训练一个将不同模态的所有信息整合为联合表示的模型,然后通过该联合表示从对应另一模态生成某一模态。我们简单地将此方法应用于变分自编码器(VAEs),称之为联合多模态变分自编码器(JMVAE)。然而,我们发现当该模型试图生成输入中缺失的大维度模态时,联合表示会发生坍缩,该模态无法成功生成。此外,我们确认即便使用已知解决方案也无法解决此困难。因此,在本研究中,我们提出两种模型来防止此困难:JMVAE-kl 和 JMVAE-h。我们的实验结果表明,这些方法能防止上述困难,并且以等于或高于传统 VAE 方法(仅单向生成)的似然双向生成模态。此外,我们确认这些方法能恰当获得联合表示,从而可通过在联合表示上移动或改变另一模态的值来生成模态的多种变体。

关键词

引用

@article{arxiv.1801.08702,
  title  = {Improving Bi-directional Generation between Different Modalities with Variational Autoencoders},
  author = {Masahiro Suzuki and Kotaro Nakayama and Yutaka Matsuo},
  journal= {arXiv preprint arXiv:1801.08702},
  year   = {2018}
}

备注

Updated version of arXiv:1611.01891