用于对齐多模态嵌入的联合 Wasserstein 自编码器
计算机视觉与模式识别
2019-09-17 v1 计算与语言
机器学习
摘要
学习多种模态(如图像与文本)的联合嵌入的关键挑战之一,是确保跨模态语义的一致性且能跨数据集泛化。我们提出通过潜表示上的联合高斯正则化来解决此问题。基于 Wasserstein 自编码器(WAEs)对各域中的输入进行编码,我们强制潜嵌入类似于跨两个域共享的高斯先验,从而保证图像与文本的编码语义表示具有兼容的连续性。语义对齐通过匹配的图像-文本对的监督实现。为展示我们半监督表示的优势,我们将其应用于跨模态检索与短语定位。我们不仅取得了最先进的准确率,而且由于潜空间语义的连续性,实现了显著更好的跨数据集泛化。
引用
@article{arxiv.1909.06635,
title = {Joint Wasserstein Autoencoders for Aligning Multimodal Embeddings},
author = {Shweta Mahajan and Teresa Botschen and Iryna Gurevych and Stefan Roth},
journal= {arXiv preprint arXiv:1909.06635},
year = {2019}
}
备注
Accepted at ICCV 2019 Workshop on Cross-Modal Learning in Real World