基于图像描述弱监督学习的层次化场景解析
计算机视觉与模式识别
2018-01-30 v2
摘要
本文研究场景理解的一个基本问题:如何将场景图像解析为结构化配置(即带有对象交互关系的语义对象层次结构)。我们提出了一种由两个网络组成的深度架构:i) 一个卷积神经网络 (CNN),用于提取图像表示以进行像素级对象标注;ii) 一个递归神经网络 (RsNN),用于发现层次化对象结构及对象间关系。我们不依赖精细的标注(例如手动标注的语义图和关系),而是通过利用训练图像的描述性句子,以弱监督学习的方式训练我们的深度模型。具体而言,我们将每个句子分解为由名词和动词短语组成的语义树,并应用这些树结构来发现训练图像的配置。一旦确定了这些场景配置,就通过反向传播相应地更新 CNN 和 RsNN 的参数。整个模型的训练通过期望最大化方法完成。大量实验表明,与其他最先进的弱监督深度学习方法相比,我们的模型能够产生有意义的场景配置,并在两个基准数据集(即 PASCAL VOC 2012 和 SYSU-Scenes)上取得更优的场景标注结果。特别地,SYSU-Scenes 包含 5000 多张带有语义句子描述的场景图像,这是我们为推进场景解析研究而创建的。
引用
@article{arxiv.1709.09490,
title = {Hierarchical Scene Parsing by Weakly Supervised Learning with Image Descriptions},
author = {Ruimao Zhang and Liang Lin and Guangrun Wang and Meng Wang and Wangmeng Zuo},
journal= {arXiv preprint arXiv:1709.09490},
year = {2018}
}
备注
Accepted by Transactions on Pattern Analysis and Machine Intelligence (T-PAMI) 2018