用于图像描述的多模态门控循环单元
计算机视觉与模式识别
2019-04-23 v1
摘要
使用自然语言句子描述图像内容是一项具挑战性但非常重要的任务。其挑战性在于描述不仅必须捕捉图像中的物体及其间关系,还须相关且语法正确。本文提出一种基于门控循环单元(GRU)的多模态嵌入模型,可为给定图像生成变长描述。在训练阶段,我们应用卷积神经网络(CNN)提取图像特征,然后将该特征与相应句子表示一同输入多模态 GRU。多模态 GRU 学习图像与句子间的跨模态关系。在测试阶段,当图像输入我们的多模态 GRU 模型时,会生成描述图像内容的句子。实验结果表明,我们的多模态 GRU 模型在 Flickr8K、Flickr30K 与 MS COCO 数据集上取得了最先进的性能。
引用
@article{arxiv.1904.09421,
title = {Multi-modal gated recurrent units for image description},
author = {Xuelong Li and Aihong Yuan and Xiaoqiang Lu},
journal= {arXiv preprint arXiv:1904.09421},
year = {2019}
}
备注
25 pages, 7 figures, 6 tables, magazine