用置换不变编码器和更紧变分目标学习多模态生成模型
机器学习
2024-09-25 v3 机器学习
摘要
设计用于多模态数据的深度潜变量模型一直是机器学习研究中的长期主题。多模态变分自编码器(VAE)是一类流行的生成模型,学习联合解释多种模态的潜表示。对此类模型已提出各种目标函数,通常作为多模态数据对数似然的下界或从信息论考虑而动机化。为从不同模态子集编码潜变量,Product-of-Experts(PoE)或 Mixture-of-Experts(MoE)聚合方案已被常规使用,并显示出不同的权衡,例如在生成质量或多模态间一致性方面。在本工作中,我们考虑一个能紧密近似数据对数似然的变分目标。我们开发了更灵活的聚合方案,通过基于置换不变神经网络组合来自不同模态的编码特征,避免了 PoE 或 MoE 方法中的归纳偏置。我们的数值实验说明了多模态变分目标和各种聚合方案的权衡。我们表明,当想要在可识别模型中近似观测模态与潜变量上的真实联合分布时,我们的变分目标和更灵活的聚合模型可能是有益的。
引用
@article{arxiv.2309.00380,
title = {Learning multi-modal generative models with permutation-invariant encoders and tighter variational objectives},
author = {Marcel Hirt and Domenico Campolo and Victoria Leong and Juan-Pablo Ortega},
journal= {arXiv preprint arXiv:2309.00380},
year = {2024}
}