中文

用于混合隐表示学习的私有-共享解耦多模态 VAE

计算机视觉与模式识别 2020-12-25 v1 机器学习

摘要

多模态生成模型是深度模型的重要族类,其目标是在具有多视图或多模态的数据上促进表示学习。然而,当前深度多模态模型聚焦于共享表示的推断,而忽视了各模态内数据的重要私有方面。本文引入一种解耦多模态变分自编码器(DMVAE),其利用解耦 VAE 策略分离多模态的私有与共享隐空间。我们具体考虑隐因子兼具连续与离散性质的情形,从而导出通用混合 DMVAE 模型族。我们在半监督学习任务上展示了 DMVAE 的效用,其中一模态含有部分数据标签,这些标签与另一模态相关或无关。我们在若干基准上的实验表明了私有-共享解耦以及混合隐表示的重要性。

关键词

引用

@article{arxiv.2012.13024,
  title  = {Private-Shared Disentangled Multimodal VAE for Learning of Hybrid Latent Representations},
  author = {Mihee Lee and Vladimir Pavlovic},
  journal= {arXiv preprint arXiv:2012.13024},
  year   = {2020}
}