中文

用于匹配图像与句子的多模态卷积神经网络

计算机视觉与模式识别 2015-09-01 v5 计算与语言 神经与进化计算

摘要

本文提出了用于匹配图像与句子的多模态卷积神经网络(m-CNN)。我们的 m-CNN 提供了一个端到端框架,利用卷积架构来挖掘图像表示、词语组合以及两种模态之间的匹配关系。具体而言,它由一个编码图像内容的图像 CNN 和一个学习图像与句子联合表示的匹配 CNN 组成。匹配 CNN 将词语组合为不同的语义片段,并在不同层级学习图像与组合片段之间的模态间关系,从而充分挖掘图像与句子之间的匹配关系。在双向图像与句子检索的基准数据库上的实验结果表明,所提出的 m-CNN 能够有效捕获图像与句子匹配所需的信息。具体而言,我们提出的用于 Flickr30K 和 Microsoft COCO 数据库双向图像与句子检索的 m-CNN 达到了最先进的性能。

关键词

引用

@article{arxiv.1504.06063,
  title  = {Multimodal Convolutional Neural Networks for Matching Image and Sentence},
  author = {Lin Ma and Zhengdong Lu and Lifeng Shang and Hang Li},
  journal= {arXiv preprint arXiv:1504.06063},
  year   = {2015}
}

备注

Accepted by ICCV 2015