中文

Hellinger 多模态变分自编码器

机器学习 2026-04-01 v3 人工智能

摘要

多模态变分自编码器(VAE)广泛用于弱监督的生成式学习。主流方法通过几何专家(PoE)、混合专家(MoE)或其组合来聚合单模态推断分布,以逼近联合后验。本文通过概率意见池化的视角重新审视多模态推断,这是一种基于优化的方法。我们从 α=0.5\alpha=0.5 处的 Holder 汇聚开始,这对应于 α\alpha-divergence 系列中唯一对称的成员,并推导出矩匹配逼近,称为 Hellinger。随后,我们利用这种逼近提出 HELVAE,一种避免抽样的多模态 VAE,具有高效且有效的模型特点:(i) 在观察到额外模态后学习更具表现力的潜在表示;(ii) 实证上在生成一致性和质量之间实现更好的权衡,超越了最先进的多模态 VAE 模型。

关键词

引用

@article{arxiv.2601.06572,
  title  = {Hellinger Multimodal Variational Autoencoders},
  author = {Huyen Vo and Isabel Valera},
  journal= {arXiv preprint arXiv:2601.06572},
  year   = {2026}
}

备注

Accepted at AISTATS 2026. Camera-ready version