探索视觉关系用于图像描述生成
计算机视觉与模式识别
2018-09-20 v1
摘要
人们一直普遍认为,对物体间关系建模有助于表示并最终描述一幅图像。然而,在图像描述生成方面尚无支持该观点的证据。本文在基于注意力的编码器-解码器框架下,引入了一种新的设计来探索物体间的联系以用于图像描述生成。具体而言,我们提出了图卷积网络结合长短期记忆网络(称为 GCN-LSTM)的架构,该架构新颖地将语义与空间物体关系整合进图像编码器。在技术上,我们基于图像中检测到的物体的空间与语义联系构建图。随后通过 GCN 利用图结构精炼基于物体提出的各区域表示。借助学习到的区域级特征,我们的 GCN-LSTM 利用带注意力机制的基于 LSTM 的描述生成框架来生成句子。我们在 COCO 图像描述数据集上进行了大量实验,与最先进的方法相比报告了更优的结果。更显著的是,GCN-LSTM 在 COCO 测试集上将 CIDEr-D 性能从 120.1% 提升至 128.7%。
引用
@article{arxiv.1809.07041,
title = {Exploring Visual Relationship for Image Captioning},
author = {Ting Yao and Yingwei Pan and Yehao Li and Tao Mei},
journal= {arXiv preprint arXiv:1809.07041},
year = {2018}
}
备注
ECCV 2018