通过迭代 amortized 推断提高多模态 VAE 中单模态潜在表示的性能
机器学习
2024-10-16 v1 人工智能
摘要
多模态变分自编码器(VAE)旨在通过整合来自不同数据模态的信息来捕获共享潜在表示。一个重要挑战是准确推断来自任何子集模态的表示,而不必为所有可能的模态组合训练不切实际数量(2^M)的推断网络。混合模型简化了这一点,只需如多于模态数量的推断模型,聚合单模态推断。然而,它们在模态缺失时会受到信息损失。对齐-based VAE 通过最小化 Kullback-Leibler(KL)散度来将单模态推断模型与多模态模型对齐,但由于 amortization 框差,会影响推断准确性。为解决这些问题,我们引入了多模态迭代 amortized 推断,这是一种在多模态 VAE 框架内的迭代细化机制。该方法克服了来自缺失模态的信息损失,并通过迭代细化使用所有可用模态的多模态推断来最小化 amortization 框差。通过将单模态推断对齐到此细化后的多模态后验,我们实现了有效地包含多模态信息的单模态推断,在推理期间仅需要单模态输入。实验在基准数据集上显示,我们的做法提高了推断性能,证明为更高的线性分类准确率和有竞争力的余弦相似性,并增强了跨模态生成,由较低的 FID 分数表明。这表明我们的方法提高了来自单模态输入的推断表示。
关键词
引用
@article{arxiv.2410.11403,
title = {Enhancing Unimodal Latent Representations in Multimodal VAEs through Iterative Amortized Inference},
author = {Yuta Oshima and Masahiro Suzuki and Yutaka Matsuo},
journal= {arXiv preprint arXiv:2410.11403},
year = {2024}
}
备注
22 pages, 12 figures