中文

用于街景语义分割的全分辨率残差网络

计算机视觉与模式识别 2016-12-07 v2

摘要

语义图像分割是现代自动驾驶系统的重要组成部分,因为对周围场景的准确理解对于导航和动作规划至关重要。当前语义图像分割的最先进方法依赖于最初为整体图像分类开发的预训练网络。虽然这些网络表现出出色的识别性能(即可见什么?),但它们缺乏定位精度(即某物具体位于何处?)。因此,必须执行额外的处理步骤以获得全图像分辨率下的像素精确分割掩码。为缓解此问题,我们提出一种新颖的类 ResNet 架构,展现出强大的定位与识别性能。我们通过在网络内使用两个处理流将多尺度上下文与像素级精度结合:一个流以全图像分辨率携带信息,从而能够精确贴合分割边界;另一个流经历一系列池化操作以获得用于识别的鲁棒特征。两个流在全图像分辨率下使用残差进行耦合。无需额外处理步骤且无需预训练,我们的方法在 Cityscapes 数据集上取得了 71.8% 的交并比得分。

关键词

引用

@article{arxiv.1611.08323,
  title  = {Full-Resolution Residual Networks for Semantic Segmentation in Street Scenes},
  author = {Tobias Pohlen and Alexander Hermans and Markus Mathias and Bastian Leibe},
  journal= {arXiv preprint arXiv:1611.08323},
  year   = {2016}
}

备注

Changes in v2: Fixed equation (10), fixed legend of Figure 6, fixed legend of Figure 9, added page numbers, fixed minor spelling mistakes