从物体、短语和区域描述生成场景图
计算机视觉与模式识别
2017-09-18 v2
摘要
物体检测、场景图生成和区域描述是在不同语义层次上的三个场景理解任务,它们相互关联:场景图是在图像中检测到的物体及其预测的成对关系之上生成的,而区域描述则给出物体、其属性、关系及其他上下文信息的语言描述。在本工作中,为利用跨语义层次的相互联系,我们提出了一种新颖的神经网络模型,称为多级场景描述网络(Multi-level Scene Description Network,简称 MSDN),以端到端的方式联合解决这三个视觉任务。首先基于物体、短语和描述区域的时空与语义连接,利用动态图将它们对齐。然后采用特征精炼结构通过图在三个语义任务层次间传递消息。我们在三个任务上对所学习模型进行了基准测试,并表明使用我们提出的方法跨三个任务的联合学习能够相较先前模型带来相互提升。特别是在场景图生成任务上,我们提出的方法以超过 3% 的优势优于当前最优(state-of-the-art)方法。
引用
@article{arxiv.1707.09700,
title = {Scene Graph Generation from Objects, Phrases and Region Captions},
author = {Yikang Li and Wanli Ouyang and Bolei Zhou and Kun Wang and Xiaogang Wang},
journal= {arXiv preprint arXiv:1707.09700},
year = {2017}
}
备注
accepted by ICCV 2017