中文

基于图像描述学习的深度结构化场景解析

计算机视觉与模式识别 2018-03-01 v3

摘要

本文解决场景理解的一个基本问题:如何将场景图像解析为结构化配置(即具有对象交互关系的语义对象层次结构),以精细符合人类感知。我们提出一种包含两种网络的深度架构:i) 卷积神经网络(CNN)提取用于逐像素对象标记的图像表示;ii) 递归神经网络(RNN)发现层次化对象结构及对象间关系。我们不依赖精细的用户标注(例如手动标记语义图和关系),而是利用训练图像的描述性句子以弱监督方式训练深度模型。具体而言,我们将每个句子分解为由名词和动词短语组成的语义树,并借助这些树来发现训练图像的配置。一旦确定这些场景配置,则通过反向传播相应更新CNN和RNN的参数。整个模型训练通过期望最大化(Expectation-Maximization)方法完成。大量实验表明,我们的模型能够生成有意义的结构化场景配置,并在PASCAL VOC 2012上取得优于其他最先进弱监督方法的场景标记性能。

关键词

引用

@article{arxiv.1604.02271,
  title  = {Deep Structured Scene Parsing by Learning with Image Descriptions},
  author = {Liang Lin and Guangrun Wang and Rui Zhang and Ruimao Zhang and Xiaodan Liang and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:1604.02271},
  year   = {2018}
}

备注

Discovering a semantic object hierarchy with object interaction relations (Publhised in Proceedings of IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2016. (oral))