中文

用于对齐多模态嵌入的联合 Wasserstein 自编码器

计算机视觉与模式识别 2019-09-17 v1 计算与语言 机器学习

摘要

学习多种模态(如图像与文本)的联合嵌入的关键挑战之一,是确保跨模态语义的一致性且能跨数据集泛化。我们提出通过潜表示上的联合高斯正则化来解决此问题。基于 Wasserstein 自编码器(WAEs)对各域中的输入进行编码,我们强制潜嵌入类似于跨两个域共享的高斯先验,从而保证图像与文本的编码语义表示具有兼容的连续性。语义对齐通过匹配的图像-文本对的监督实现。为展示我们半监督表示的优势,我们将其应用于跨模态检索与短语定位。我们不仅取得了最先进的准确率,而且由于潜空间语义的连续性,实现了显著更好的跨数据集泛化。

关键词

引用

@article{arxiv.1909.06635,
  title  = {Joint Wasserstein Autoencoders for Aligning Multimodal Embeddings},
  author = {Shweta Mahajan and Teresa Botschen and Iryna Gurevych and Stefan Roth},
  journal= {arXiv preprint arXiv:1909.06635},
  year   = {2019}
}

备注

Accepted at ICCV 2019 Workshop on Cross-Modal Learning in Real World