多模态变分自编码器:双坐标视角
机器学习
2024-12-31 v1 计算机视觉与模式识别
信息论
math.IT
摘要
多种信号模态(如视觉和声音)在现实世界现象中天然存在。最近人们越来越关注学习生成模型,特别是变分自编码器(VAE),以实现多模态表示学习,尤其是在存在缺失模态的情况下。这些模型的主要目标是学习一种跨模态不变且模态特定的表征,以刻画多个模态之间的信息。以往的多模态 VAE 尝试主要通过专家视角来实现,这些方法通过乘积专家(PoE)、混合专家(MoE)或两者的组合来聚合单模态推断分布。本文通过双坐标视角,提供了一种通用且理论化的多模态 VAE 表述。我们首先表明,PoE 和 MoE 是双坐标的具体实例,是通过最小化对单模态推断分布的非对称加权 KL 发散得出。我们的新表述通过考虑不同类型的发散,扩展了这两种双坐标,以获得更灵活的选择。特别是,我们探索了由 2-Wasserstein 距离定义的 Wasserstein 双坐标,它通过捕捉模态特定和模态不变表征,较好地保留了单模态分布的几何结构。在三个多模态基准数据集上的实证研究表明,所提方法有效。
引用
@article{arxiv.2412.20487,
title = {Multimodal Variational Autoencoder: a Barycentric View},
author = {Peijie Qiu and Wenhui Zhu and Sayantan Kumar and Xiwen Chen and Xiaotong Sun and Jin Yang and Abolfazl Razi and Yalin Wang and Aristeidis Sotiras},
journal= {arXiv preprint arXiv:2412.20487},
year = {2024}
}
备注
AAAI 2025