用于多模态深度生成模型的混合专家变分自编码器
机器学习
2019-11-11 v1 机器学习
摘要
学习跨越多种数据模态(如视觉与语言)的生成模型,通常出于学习更有用、更具泛化性的表征的动机,以忠实捕捉模态间共同的潜在因素。本工作中,我们将此类模型的成功学习刻画为满足四个准则:i) 隐空间隐式分解为共享与私有子空间,ii) 所有模态上的连贯联合生成,iii) 各单独模态间的连贯交叉生成,iv) 通过多模态融合改进单模态的模型学习。在此,我们提出一种混合专家多模态变分自编码器(MMVAE),以在不同模态集合(包括具有挑战性的图像-语言数据集)上学习生成模型,并从定性与定量两方面证明其满足全部四个准则的能力。
引用
@article{arxiv.1911.03393,
title = {Variational Mixture-of-Experts Autoencoders for Multi-Modal Deep Generative Models},
author = {Yuge Shi and N. Siddharth and Brooks Paige and Philip H. S. Torr},
journal= {arXiv preprint arXiv:1911.03393},
year = {2019}
}