中文

多模态变分自编码器中依赖专家分布的聚合

机器学习 2025-05-05 v1

摘要

使用变分自编码器(VAE)的多模态学习需要估计联合分布以评估证据下界(ELBO)。当前的方法,即专家乘积和专家混合,为简化起见,在假设各模态分布独立的条件下聚合单模态分布,这是一个过于乐观的假设。本研究引入了一种新颖的方法,通过利用依赖专家共识(CoDE)原理来聚合单模态分布,从而规避了上述假设。利用 CoDE 方法,我们提出了一个新的 ELBO,通过学习每个模态子集的贡献来近似多模态数据的联合似然。所得到的 CoDE-VAE 模型在平衡生成连贯性与生成质量之间的权衡方面表现出更好的性能,并能生成更精确的对数似然估计。随着模态数量的增加,CoDE-VAE 进一步缩小了生成质量差距。在某些情况下,它达到了与单模态 VAE 相似的生成质量,这是当前大多数方法所缺乏的理想特性。最后,CoDE-VAE 取得的分类准确率可与最先进的多模态 VAE 模型相媲美。

关键词

引用

@article{arxiv.2505.01134,
  title  = {Aggregation of Dependent Expert Distributions in Multimodal Variational Autoencoders},
  author = {Rogelio A Mancisidor and Robert Jenssen and Shujian Yu and Michael Kampffmeyer},
  journal= {arXiv preprint arXiv:2505.01134},
  year   = {2025}
}