中文

探索视觉关系用于图像描述生成

计算机视觉与模式识别 2018-09-20 v1

摘要

人们一直普遍认为,对物体间关系建模有助于表示并最终描述一幅图像。然而,在图像描述生成方面尚无支持该观点的证据。本文在基于注意力的编码器-解码器框架下,引入了一种新的设计来探索物体间的联系以用于图像描述生成。具体而言,我们提出了图卷积网络结合长短期记忆网络(称为 GCN-LSTM)的架构,该架构新颖地将语义与空间物体关系整合进图像编码器。在技术上,我们基于图像中检测到的物体的空间与语义联系构建图。随后通过 GCN 利用图结构精炼基于物体提出的各区域表示。借助学习到的区域级特征,我们的 GCN-LSTM 利用带注意力机制的基于 LSTM 的描述生成框架来生成句子。我们在 COCO 图像描述数据集上进行了大量实验,与最先进的方法相比报告了更优的结果。更显著的是,GCN-LSTM 在 COCO 测试集上将 CIDEr-D 性能从 120.1% 提升至 128.7%。

关键词

引用

@article{arxiv.1809.07041,
  title  = {Exploring Visual Relationship for Image Captioning},
  author = {Ting Yao and Yingwei Pan and Yehao Li and Tao Mei},
  journal= {arXiv preprint arXiv:1809.07041},
  year   = {2018}
}

备注

ECCV 2018