中文

从图像描述中挖掘信息用于弱监督语义分割

计算机视觉与模式识别 2019-05-17 v1

摘要

由于获取像素级标注以训练用于语义图像分割的卷积神经网络非常耗时,仅需要类别标签的弱监督方法已被提出。在本工作中,我们提出另一种监督形式,即网络上可找到的图像描述。这些描述有两个优势:它们不需要像当前弱监督方法所用的干净类别标签那样额外筛选,并且它们为图像中出现的类别提供文本上下文。为利用此类文本上下文,我们部署了一个多模态网络,学习图像视觉表示与描述文本表示的联合嵌入。该网络估计类名以及复合概念(即名词与其属性的组合)的文本激活图(TAMs)。描述感兴趣类别的复合概念的 TAMs 显著提升了所估计类别激活图的质量,这些激活图随后用于训练语义分割网络。我们在 COCO 数据集上评估我们的方法,其在弱监督图像分割上取得了 SOTA 结果。

关键词

引用

@article{arxiv.1905.06784,
  title  = {Harvesting Information from Captions for Weakly Supervised Semantic Segmentation},
  author = {Johann Sawatzky and Debayan Banerjee and Juergen Gall},
  journal= {arXiv preprint arXiv:1905.06784},
  year   = {2019}
}