中文

语义非模态分割

计算机视觉与模式识别 2016-12-15 v2

摘要

常见的视觉识别任务(如分类、目标检测和语义分割)正迅速趋于成熟,且鉴于近期的进展速度,推测其中许多问题的技术将在未来几年内接近人类水平并非不切实际。在本文中,我们展望未来:视觉识别的下一个前沿是什么?我们为这一问题提供了一个可能的答案。我们提出了一种详细的图像标注方法,以捕获可见像素之外的信息,并需要对完整场景结构进行复杂推理。具体而言,我们对每幅图像创建非模态分割:标记每个区域的完整范围,而不仅仅是可见像素。标注者勾勒并命名图像中所有显著区域,并指定部分深度顺序。其结果是丰富的场景结构,包括每个区域的可见和遮挡部分、图形-背景边缘信息、语义标签以及目标重叠。我们创建了两个用于语义非模态分割的数据集。首先,我们对 BSDS 数据集中的 500 幅图像进行标注,每幅图像由多名标注者完成,从而研究人类标注的统计数据。我们表明,所提出的完整场景标注在标注者之间具有惊人的一致性,包括区域和边缘。其次,我们对来自 COCO 的 5000 幅图像进行标注。这一更大的数据集使我们能够探索关于非模态分割和深度排序的多种算法思路。我们为这些任务引入了新的评估指标,并结合我们强大的基线,为社区定义了具体的新挑战。

关键词

引用

@article{arxiv.1509.01329,
  title  = {Semantic Amodal Segmentation},
  author = {Yan Zhu and Yuandong Tian and Dimitris Mexatas and Piotr Dollár},
  journal= {arXiv preprint arXiv:1509.01329},
  year   = {2016}
}

备注

major update including new COCO data, metrics, and baselines