用于图像描述的场景图自编码
计算机视觉与模式识别
2018-12-12 v3
摘要
我们提出场景图自编码器(SGAE),将语言归纳偏置引入编码器-解码器图像描述框架,以生成更类人的描述。直观上,人类在语篇中使用归纳偏置来组合搭配并进行上下文推断。例如,当我们看到关系“person on bike”时,很自然地将“on”替换为“ride”并推断“person riding bike on a road”,即便“road”并不明显。因此,利用这种偏置作为语言先验,有望帮助常规编码器-解码器模型更少过拟合于数据集偏置,并聚焦于推理。具体而言,我们使用场景图——一种有向图(),其中对象节点由形容词节点和关系节点连接——来表示图像()与句子()的复杂结构布局。在文本域中,我们使用 SGAE 学习一个字典(),帮助在 流水线中重建句子,其中 编码所需的语言先验;在视觉-语言域中,我们使用共享的 在 流水线中引导编码器-解码器。得益于场景图表示与共享字典,归纳偏置原则上可跨域迁移。我们在具挑战性的 MS-COCO 图像描述基准上验证了 SGAE 的有效性,例如,我们基于 SGAE 的单模型在 Karpathy 划分上取得了新的 SOTA CIDEr-D,并且在官方服务器上即使与其他集成模型相比也取得了具竞争力的 CIDEr-D (c40)。
引用
@article{arxiv.1812.02378,
title = {Auto-Encoding Scene Graphs for Image Captioning},
author = {Xu Yang and Kaihua Tang and Hanwang Zhang and Jianfei Cai},
journal= {arXiv preprint arXiv:1812.02378},
year = {2018}
}