用于图像字幕生成的3G结构
计算机视觉与模式识别
2019-04-23 v1
摘要
让机器用自然语言句子自动描述图像内容,是计算机视觉领域的一大挑战。以往工作在该任务上取得了很大进展,但仅使用全局或局部图像特征,可能丢失图像中一些重要的细微或全局信息。本文提出一种带有3门控结构的模型,将全局与局部图像特征融合用于图像字幕生成任务。该模型主要包含三个门控结构:1) 全局图像特征门,可自适应决定何时以及以多大程度将全局图像特征输入句子生成器;2) 采用门控循环神经网络(RNN)作为句子生成器;3) 采用用于堆叠RNN的门控反馈方法以增强非线性拟合能力。更具体地,本文中全局与局部图像特征被结合在一起,充分利用了图像信息。全局图像特征由第一门控制,局部图像特征由注意力机制筛选。借助后两个门,图像与文本之间的关系得以良好挖掘,从而提升了语言部分以及多模态嵌入部分的性能。实验结果表明,我们所提方法在图像字幕生成上优于当前最优(state-of-the-art)方法。
引用
@article{arxiv.1904.09544,
title = {3G structure for image caption generation},
author = {Aihong Yuan and Xuelong Li and Xiaoqiang Lu},
journal= {arXiv preprint arXiv:1904.09544},
year = {2019}
}
备注
35 pages, 7 figures, magazine