中文

论多模态变分自编码器的局限性

机器学习 2022-04-08 v2

摘要

多模态变分自编码器(VAEs)作为弱监督数据的高效生成模型已展现出潜力。然而,尽管其具有弱监督的优势,与完全无监督的单模态 VAE 相比,它们在生成质量上仍存在差距。为解释这一差距,我们揭示了一类基于混合的大型多模态 VAE 家族所共有的一个根本性局限。我们证明,模态的子采样对多模态 ELBO 施加了一个不期望的上界,从而限制了相应模型的生成质量。在实证上,我们在合成数据与真实数据上展示了生成质量的差距,并呈现了不同多模态 VAE 变体之间的权衡。我们发现,当应用于比以往基准所用更为复杂的数据集时,现有方法均无法满足一个有效多模态生成模型的所有期望标准。总之,我们识别、形式化并验证了基于 VAE 的方法在建模弱监督数据时的根本性局限,并讨论了其对实际应用的启示。

关键词

引用

@article{arxiv.2110.04121,
  title  = {On the Limitations of Multimodal VAEs},
  author = {Imant Daunhawer and Thomas M. Sutter and Kieran Chin-Cheong and Emanuele Palumbo and Julia E. Vogt},
  journal= {arXiv preprint arXiv:2110.04121},
  year   = {2022}
}

备注

ICLR 2022 camera-ready version