中文

基于多模态循环神经网络(m-RNN)的深度图像描述生成

计算机视觉与模式识别 2015-06-12 v5 计算与语言 机器学习

摘要

本文提出一种用于生成新颖图像描述的多模态循环神经网络(m-RNN)模型。该模型直接对给定先前词语和图像条件下生成某个词语的概率分布进行建模。图像描述通过从该分布中采样生成。模型由两个子网络构成:一个用于句子的深度循环神经网络和一个用于图像的深度卷积网络。这两个子网络在多模态层中相互作用,构成完整的m-RNN模型。模型的有效性在四个基准数据集(IAPR TC-12、Flickr 8K、Flickr 30K和MS COCO)上得到验证。我们的模型性能优于当前最优方法。此外,我们将m-RNN模型应用于检索任务,用于检索图像或句子,相比直接优化检索排序目标函数的现有最优方法,取得了显著的性能提升。本项目页面为:www.stat.ucla.edu/~junhua.mao/m-RNN.html。

关键词

引用

@article{arxiv.1412.6632,
  title  = {Deep Captioning with Multimodal Recurrent Neural Networks (m-RNN)},
  author = {Junhua Mao and Wei Xu and Yi Yang and Jiang Wang and Zhiheng Huang and Alan Yuille},
  journal= {arXiv preprint arXiv:1412.6632},
  year   = {2015}
}

备注

Add a simple strategy to boost the performance of image captioning task significantly. More details are shown in Section 8 of the paper. The code and related data are available at https://github.com/mjhucla/mRNN-CR ;. arXiv admin note: substantial text overlap with arXiv:1410.1090