中文

统一视觉 - 语义嵌入与多模态神经语言模型

机器学习 2014-11-11 v1 计算与语言 计算机视觉与模式识别

摘要

受多模态学习和机器翻译近期进展的启发,我们引入了一种编码器 - 解码器流程,该流程学习:(a) 一个包含图像和文本的多模态联合嵌入空间,以及 (b) 一种用于从我们的空间解码分布式表示的新型语言模型。我们的流程有效地统一了联合图像 - 文本嵌入模型与多模态神经语言模型。我们提出了结构 - 内容神经语言模型,该模型在编码器生成的表示条件下,将句子结构与其内容解耦。编码器能够对图像和句子进行排序,而解码器则可以从头生成新颖的描述。利用 LSTM 对句子进行编码,我们在不使用物体检测的情况下,在 Flickr8K 和 Flickr30K 数据集上达到了最先进的性能。此外,当我们使用 19 层 Oxford 卷积网络时,也创造了新的最佳结果。我们还表明,对于线性编码器,学习到的嵌入空间通过向量空间算术捕捉了多模态规律性,例如*蓝色汽车的图像* - "蓝色" + "红色" 接近红色汽车的图像。我们为 800 张图像生成的样本标题已公开以供比较。

关键词

引用

@article{arxiv.1411.2539,
  title  = {Unifying Visual-Semantic Embeddings with Multimodal Neural Language Models},
  author = {Ryan Kiros and Ruslan Salakhutdinov and Richard S. Zemel},
  journal= {arXiv preprint arXiv:1411.2539},
  year   = {2014}
}

备注

13 pages. NIPS 2014 deep learning workshop