ShaLa:多模态共享潜在空间建模
机器学习
2025-08-26 v1 计算机视觉与模式识别
摘要
本文提出了一种新型生成框架,用于学习跨模态数据的共享潜在表示。许多先进的多模态方法专注于捕捉输入中所有模态特定细节的组合,这可能会无意中掩盖跨模态共享的高层次语义概念。值得注意的是,低维潜在变量的多模态VAE旨在捕捉共享表示,使其能够实现诸如联合多模态合成和跨模态推理等各种任务。然而,多模态VAE往往难以设计具有表达力的联合变分后验,导致合成质量较差。本文中,ShaLa通过整合一种新型推理模型和第二阶段的表达扩散先验,既促进了共享潜在表示的有效推断,又显著提高了下游多模态合成的质量。我们在多个基准数据集上广泛验证了ShaLa,表明其在连贯性和合成质量方面优于最先进的多模态VAE。此外,ShaLa能够扩展到更多模态,而先前的多模态VAE在捕捉共享潜在空间日益复杂的方面已显不足。
引用
@article{arxiv.2508.17376,
title = {ShaLa: Multimodal Shared Latent Space Modelling},
author = {Jiali Cui and Yan-Ying Chen and Yanxia Zhang and Matthew Klenk},
journal= {arXiv preprint arXiv:2508.17376},
year = {2025}
}