中文

城市场景的实时高性能语义图像分割

计算机视觉与模式识别 2020-04-06 v2

摘要

深度卷积神经网络(DCNNs)近期在语义图像分割中展现出卓越性能。然而,最先进的基于DCNN的语义分割方法通常因使用复杂网络架构而计算复杂度高。这极大限制了它们在需要实时处理的真实场景中的应用。本文提出一种基于DCNN的实时高性能方法,用于城市场景的鲁棒语义分割,其在精度与速度间取得良好权衡。具体而言,首先使用带空洞卷积与注意力的轻量基线网络(LBN-AA)作为基线网络以高效获取稠密特征图。然后,开发利用不同大小池化操作编码丰富且具区分性语义信息的独特空洞空间金字塔池化(DASPP)以多尺度检测物体。同时,设计具有浅卷积层的空间细节保持网络(SPN)以生成保留详细空间信息的高分辨率特征图。最后,使用简单但实用的特征融合网络(FFN)有效结合来自语义分支(DASPP)与空间分支(SPN)的浅层与深层特征。大量实验结果表明,所提方法在具挑战性的Cityscapes和CamVid测试数据集上(仅使用单张NVIDIA TITAN X卡)分别以51.0 fps和39.3 fps的推理速度取得73.6%和68.0%的平均交并比(mIoU)精度。这表明所提方法在城市场景语义分割的实时速度下提供了优异性能。

关键词

引用

@article{arxiv.2003.08736,
  title  = {Real-Time High-Performance Semantic Image Segmentation of Urban Street Scenes},
  author = {Genshun Dong and Yan Yan and Chunhua Shen and Hanzi Wang},
  journal= {arXiv preprint arXiv:2003.08736},
  year   = {2020}
}