中文

用于多模态深度生成模型的混合专家变分自编码器

机器学习 2019-11-11 v1 机器学习

摘要

学习跨越多种数据模态(如视觉与语言)的生成模型,通常出于学习更有用、更具泛化性的表征的动机,以忠实捕捉模态间共同的潜在因素。本工作中,我们将此类模型的成功学习刻画为满足四个准则:i) 隐空间隐式分解为共享与私有子空间,ii) 所有模态上的连贯联合生成,iii) 各单独模态间的连贯交叉生成,iv) 通过多模态融合改进单模态的模型学习。在此,我们提出一种混合专家多模态变分自编码器(MMVAE),以在不同模态集合(包括具有挑战性的图像-语言数据集)上学习生成模型,并从定性与定量两方面证明其满足全部四个准则的能力。

关键词

引用

@article{arxiv.1911.03393,
  title  = {Variational Mixture-of-Experts Autoencoders for Multi-Modal Deep Generative Models},
  author = {Yuge Shi and N. Siddharth and Brooks Paige and Philip H. S. Torr},
  journal= {arXiv preprint arXiv:1911.03393},
  year   = {2019}
}