中文

多样性中的统一:多模态 VAE 中改进的表示学习

机器学习 2025-01-08 v5 人工智能

摘要

用于多模态数据的变分自编码器在数据分析的许多任务中展现出前景,例如表示学习、条件生成和插补。当前的架构要么在多模态间共享编码器输出、解码器输入,要么两者都共享,以学习共享表示。此类架构对模型施加了硬约束。在本工作中,我们表明通过用软约束替换这些硬约束可以获得更好的潜在表示。我们提出了一种新的混合专家先验,柔和地引导每种模态的潜在表示趋向于共享的聚合后验。这种方法产生了更优越的潜在表示,并允许每种编码更好地保留其未压缩原始特征中的信息。在多个基准数据集和两个具有挑战性的真实世界数据集上的大量实验中,我们展示了与现有方法相比,学习到的潜在表示有所改进,且缺失数据模态的插补效果更好。

关键词

引用

@article{arxiv.2403.05300,
  title  = {Unity by Diversity: Improved Representation Learning in Multimodal VAEs},
  author = {Thomas M. Sutter and Yang Meng and Andrea Agostini and Daphné Chopard and Norbert Fortin and Julia E. Vogt and Babak Shahbaba and Stephan Mandt},
  journal= {arXiv preprint arXiv:2403.05300},
  year   = {2025}
}

备注

Accepted at Neurips 2024