中文

用于街景理解的单一网络全景分割

计算机视觉与模式识别 2019-02-08 v1

摘要

本工作中,我们提出一种用于全景分割的单一深度神经网络,其目标是为输入图像的每个像素提供类标签(如语义分割),并为图像中特定对象提供唯一标识符(遵循实例分割)。我们的网络联合进行语义与实例分割预测,并将二者结合以全景格式形成输出。这有两个主要好处:首先,整个全景预测一次性完成,减少了所需计算时间与资源;其次,通过联合学习任务,两任务间共享信息,从而提升性能。我们的网络在两个街景数据集 Cityscapes 与 Mapillary Vistas 上进行了评估。通过利用信息交换并改进合并启发式方法,我们提升了单一网络的性能,在 Mapillary Vistas 验证集上以 640 x 900 像素输入分辨率取得 23.9 的全景质量(PQ)分数。在 Cityscapes 验证集上,我们的方法以 512 x 1024 像素输入分辨率取得 45.9 的 PQ 分数。此外,相较于分离网络,我们的方法将预测时间减少了 2 倍。

关键词

引用

@article{arxiv.1902.02678,
  title  = {Single Network Panoptic Segmentation for Street Scene Understanding},
  author = {Daan de Geus and Panagiotis Meletis and Gijs Dubbelman},
  journal= {arXiv preprint arXiv:1902.02678},
  year   = {2019}
}