中文

基于约束嵌入空间映射的多模态数据条件生成

机器学习 2017-07-27 v2 人工智能 计算机视觉与模式识别

摘要

我们提出一种条件生成模型,该模型将多种模态数据的低维嵌入映射到一个公共潜在空间,从而提取它们之间的语义关系。首先提取特定于某一模态的嵌入,随后执行约束优化过程将两个嵌入空间投影到公共流形上。各个嵌入从该公共潜在空间生成回来。然而,为了能够实现独立的条件推断以从公共潜在空间表示中分别提取相应的嵌入,我们采用了一种代理变量技巧——其中,单一共享潜在空间被每个模态各自的独立潜在空间所替代。我们设计了一个目标函数,使得在训练期间能够通过最小化其概率分布函数之间的距离来迫使这些独立空间彼此接近。实验结果表明,所学习的联合模型能够泛化到从文本和语音输入中学习具有额外颜色属性的双 MNIST 数字概念。

关键词

引用

@article{arxiv.1707.00860,
  title  = {Conditional generation of multi-modal data using constrained embedding space mapping},
  author = {Subhajit Chaudhury and Sakyasingha Dasgupta and Asim Munawar and Md. A. Salam Khan and Ryuki Tachibana},
  journal= {arXiv preprint arXiv:1707.00860},
  year   = {2017}
}

备注

7 pages, 4 figures, ICML 2017 Workshop on Implicit Models