Hellinger 多模态变分自编码器
机器学习
2026-04-01 v3 人工智能
摘要
多模态变分自编码器(VAE)广泛用于弱监督的生成式学习。主流方法通过几何专家(PoE)、混合专家(MoE)或其组合来聚合单模态推断分布,以逼近联合后验。本文通过概率意见池化的视角重新审视多模态推断,这是一种基于优化的方法。我们从 处的 Holder 汇聚开始,这对应于 -divergence 系列中唯一对称的成员,并推导出矩匹配逼近,称为 Hellinger。随后,我们利用这种逼近提出 HELVAE,一种避免抽样的多模态 VAE,具有高效且有效的模型特点:(i) 在观察到额外模态后学习更具表现力的潜在表示;(ii) 实证上在生成一致性和质量之间实现更好的权衡,超越了最先进的多模态 VAE 模型。
关键词
引用
@article{arxiv.2601.06572,
title = {Hellinger Multimodal Variational Autoencoders},
author = {Huyen Vo and Isabel Valera},
journal= {arXiv preprint arXiv:2601.06572},
year = {2026}
}
备注
Accepted at AISTATS 2026. Camera-ready version