中文

用于图像描述的场景图自编码

计算机视觉与模式识别 2018-12-12 v3

摘要

我们提出场景图自编码器(SGAE),将语言归纳偏置引入编码器-解码器图像描述框架,以生成更类人的描述。直观上,人类在语篇中使用归纳偏置来组合搭配并进行上下文推断。例如,当我们看到关系“person on bike”时,很自然地将“on”替换为“ride”并推断“person riding bike on a road”,即便“road”并不明显。因此,利用这种偏置作为语言先验,有望帮助常规编码器-解码器模型更少过拟合于数据集偏置,并聚焦于推理。具体而言,我们使用场景图——一种有向图(G\mathcal{G}),其中对象节点由形容词节点和关系节点连接——来表示图像(I\mathcal{I})与句子(S\mathcal{S})的复杂结构布局。在文本域中,我们使用 SGAE 学习一个字典(D\mathcal{D}),帮助在 SGDS\mathcal{S}\rightarrow \mathcal{G} \rightarrow \mathcal{D} \rightarrow \mathcal{S} 流水线中重建句子,其中 D\mathcal{D} 编码所需的语言先验;在视觉-语言域中,我们使用共享的 D\mathcal{D}IGDS\mathcal{I}\rightarrow \mathcal{G}\rightarrow \mathcal{D} \rightarrow \mathcal{S} 流水线中引导编码器-解码器。得益于场景图表示与共享字典,归纳偏置原则上可跨域迁移。我们在具挑战性的 MS-COCO 图像描述基准上验证了 SGAE 的有效性,例如,我们基于 SGAE 的单模型在 Karpathy 划分上取得了新的 SOTA 127.8127.8 CIDEr-D,并且在官方服务器上即使与其他集成模型相比也取得了具竞争力的 125.5125.5 CIDEr-D (c40)。

关键词

引用

@article{arxiv.1812.02378,
  title  = {Auto-Encoding Scene Graphs for Image Captioning},
  author = {Xu Yang and Kaihua Tang and Hanwang Zhang and Jianfei Cai},
  journal= {arXiv preprint arXiv:1812.02378},
  year   = {2018}
}