中文

通过 MCMC 修订学习基于变分自编码器的多模态能量基模型

机器学习 2026-05-04 v1 人工智能

摘要

能量基模型(EBM)是一类灵活的深生成模型,适用于捕捉多模态数据中复杂的依赖关系。然而,通过最大似然学习多模态 EBM 需要在联合数据空间中进行马尔可夫链蒜蓉(MCMC)采样,噪声初始化的 Langevin 动力学往往混合不良,难以发现一致的跨模态关系。多模态变分自编码器(VAE)通过引入共享潜在生成器和联合推断模型,已在捕捉此类跨模态依赖方面取得了进展。然而,共享潜在生成器和联合推断模型的参数化为单模态高斯(或拉普拉斯),严重限制了其近似由多模态数据引起的复杂结构的能力。本文研究了多模态 EBM、共享潜在生成器和联合推断模型的学习问题。我们提出一种学习框架,有效地将它们的 MLE 更新与数据空间和潜在空间中的相应 MCMC 修正交织在一起。具体而言,生成器学习以产生一致的多模态样本作为 EBM 采样的强初始状态;推断模型学习为生成器后验采样提供信息丰富的潜在初始值。这两个模型作为互补模型,协同实现有效的 EBM 采样和学习,产生真实且连贯的多模态 EBM 样本。大量实验表明,我们的方法在多模态合成质量和连贯性方面优于各种基线方法。我们进行了各种分析和消融研究,以验证所提方法的有效性和可扩展性。

关键词

引用

@article{arxiv.2605.00644,
  title  = {Learning Multimodal Energy-Based Model with Multimodal Variational Auto-Encoder via MCMC Revision},
  author = {Jiali Cui and Zhiqiang Lao and Heather Yu},
  journal= {arXiv preprint arXiv:2605.00644},
  year   = {2026}
}

备注

Transactions on Machine Learning Research, 2026