中文

用于图像描述的循环融合网络

计算机视觉与模式识别 2018-08-01 v3

摘要

近年来,图像描述取得了诸多进展,所有最先进模型均采用了编码器-解码器框架。在该框架下,输入图像由卷积神经网络(CNN)编码,再由循环神经网络(RNN)译为自然语言。现有依赖该框架的模型仅采用单一 CNN(如 ResNet 或 Inception-X),仅从某一特定视角描述图像内容。因此,输入图像的语义无法被全面理解,限制了描述性能。本文为利用多编码器的互补信息,提出一种新颖的循环融合网络(RFNet)来处理图像描述。我们模型中的融合过程可利用图像编码器输出间的交互,进而为解码器生成紧凑且具信息量的新表示。在 MSCOCO 数据集上的实验证明了所提 RFNet 的有效性,其确立了图像描述的新的 SOTA。

关键词

引用

@article{arxiv.1807.09986,
  title  = {Recurrent Fusion Network for Image Captioning},
  author = {Wenhao Jiang and Lin Ma and Yu-Gang Jiang and Wei Liu and Tong Zhang},
  journal= {arXiv preprint arXiv:1807.09986},
  year   = {2018}
}

备注

ECCV-18