中文

用于图像描述生成的反射解码网络

计算机视觉与模式识别 2019-09-02 v1

摘要

最先进的图像描述生成方法大多聚焦于改进视觉特征,较少关注利用语言的内在属性来提升描述性能。本文中,我们表明词间的词汇连贯性与句子的句法范式对于生成高质量图像描述同样重要。遵循常规的编码器-解码器框架,我们提出用于图像描述生成的反射解码网络(RDN),其增强了描述解码器中词的长期序列依赖与位置感知。我们的模型学习协同关注视觉与文本特征,同时感知每个词在句子中的相对位置,以最大化生成描述所传递的信息。我们在 COCO 图像描述数据集上评估了 RDN 的有效性,并取得了优于先前方法的性能。进一步实验揭示,我们的方法对于需用描述刻画的复杂场景等困难案例尤为有利。

关键词

引用

@article{arxiv.1908.11824,
  title  = {Reflective Decoding Network for Image Captioning},
  author = {Lei Ke and Wenjie Pei and Ruiyu Li and Xiaoyong Shen and Yu-Wing Tai},
  journal= {arXiv preprint arXiv:1908.11824},
  year   = {2019}
}

备注

ICCV 2019