中文

用于组合式表示学习的多模态生成模型

机器学习 2019-12-12 v1 机器学习

摘要

随着深度神经网络在传统任务上愈发熟练,许多最令人振奋的新挑战涉及多模态——结合如图像与文本等多样类型的观测。本文中,我们引入一类源自证据(数据边际似然)变分界的多模态深度生成模型。在推导中我们发现,许多先前的多模态变分自编码器使用的目标并未正确界定跨模态的联合边际似然。我们进一步将目标推广至适用于多种深度生成模型(VAE、GAN 与基于流的模型),并允许不同模态使用不同模型类型。我们在许多图像、标签与文本数据集上基准测试我们的模型,发现我们的多模态 VAE 在有与无弱监督下均表现出色。使用 GAN 图像模型与 VAE 语言模型带来额外提升。最后,我们通过多种下游任务(如组合性、边界框预测与视觉关系预测)探究语言对所学图像表示的影响。我们发现证据表明,这些图像表示比仅从视觉数据学习的等价表示更抽象且更具组合性。

关键词

引用

@article{arxiv.1912.05075,
  title  = {Multimodal Generative Models for Compositional Representation Learning},
  author = {Mike Wu and Noah Goodman},
  journal= {arXiv preprint arXiv:1912.05075},
  year   = {2019}
}

备注

24 pages content; 7 pages appendix