中文

基于每类仅一个标注像素的复杂驾驶场景像素级语义学习

计算机视觉与模式识别 2020-03-11 v1

摘要

基于弱监督条件的语义分割任务已被提出以实现轻量化标注过程。对于仅包含少数类别的简单图像,基于图像级标注的研究已获得可接受的性能。然而,当面对复杂场景时,由于图像包含大量类别,基于图像标签学习视觉外观变得困难。在这种情况下,图像级标注在提供信息方面并不有效。因此,我们建立了一项新任务,其中每个类别仅提供一个标注像素。基于更轻量且更具信息量的条件,我们构建了一个三步流程用于伪标签生成,逐步实现对每一类的最优特征表示、图像推断以及基于上下文-位置的精炼。特别地,由于在驾驶场景下高层语义与低层成像特征对每一类具有不同的判别能力,我们将每个类别划分为“物体”或“场景”,并分别为这两类提供不同的操作。此外,建立了一种交替迭代结构以逐步提升分割性能,其结合了基于CNN的图像间公共语义学习和基于成像先验的图像内修正过程。在Cityscapes数据集上的实验表明,所提方法为解决复杂驾驶场景下的弱监督语义分割任务提供了一种可行途径。

关键词

引用

@article{arxiv.2003.04671,
  title  = {Realizing Pixel-Level Semantic Learning in Complex Driving Scenes based on Only One Annotated Pixel per Class},
  author = {Xi Li and Huimin Ma and Sheng Yi and Yanxian Chen},
  journal= {arXiv preprint arXiv:2003.04671},
  year   = {2020}
}