用于匹配图像与句子的多模态卷积神经网络
计算机视觉与模式识别
2015-09-01 v5 计算与语言
神经与进化计算
摘要
本文提出了用于匹配图像与句子的多模态卷积神经网络(m-CNN)。我们的 m-CNN 提供了一个端到端框架,利用卷积架构来挖掘图像表示、词语组合以及两种模态之间的匹配关系。具体而言,它由一个编码图像内容的图像 CNN 和一个学习图像与句子联合表示的匹配 CNN 组成。匹配 CNN 将词语组合为不同的语义片段,并在不同层级学习图像与组合片段之间的模态间关系,从而充分挖掘图像与句子之间的匹配关系。在双向图像与句子检索的基准数据库上的实验结果表明,所提出的 m-CNN 能够有效捕获图像与句子匹配所需的信息。具体而言,我们提出的用于 Flickr30K 和 Microsoft COCO 数据库双向图像与句子检索的 m-CNN 达到了最先进的性能。
引用
@article{arxiv.1504.06063,
title = {Multimodal Convolutional Neural Networks for Matching Image and Sentence},
author = {Lin Ma and Zhengdong Lu and Lifeng Shang and Hang Li},
journal= {arXiv preprint arXiv:1504.06063},
year = {2015}
}
备注
Accepted by ICCV 2015