中文

用于图像描述的多模态门控循环单元

计算机视觉与模式识别 2019-04-23 v1

摘要

使用自然语言句子描述图像内容是一项具挑战性但非常重要的任务。其挑战性在于描述不仅必须捕捉图像中的物体及其间关系,还须相关且语法正确。本文提出一种基于门控循环单元(GRU)的多模态嵌入模型,可为给定图像生成变长描述。在训练阶段,我们应用卷积神经网络(CNN)提取图像特征,然后将该特征与相应句子表示一同输入多模态 GRU。多模态 GRU 学习图像与句子间的跨模态关系。在测试阶段,当图像输入我们的多模态 GRU 模型时,会生成描述图像内容的句子。实验结果表明,我们的多模态 GRU 模型在 Flickr8K、Flickr30K 与 MS COCO 数据集上取得了最先进的性能。

关键词

引用

@article{arxiv.1904.09421,
  title  = {Multi-modal gated recurrent units for image description},
  author = {Xuelong Li and Aihong Yuan and Xiaoqiang Lu},
  journal= {arXiv preprint arXiv:1904.09421},
  year   = {2019}
}

备注

25 pages, 7 figures, 6 tables, magazine