中文

面向街景实时语义分割的深度多分支聚合网络

计算机视觉与模式识别 2022-03-09 v1

摘要

实时语义分割旨在以实时推理速度实现高分割精度,近年来受到广泛关注。然而,许多最先进的实时语义分割方法往往为快速推理牺牲部分空间细节或上下文信息,从而导致分割质量下降。本文中,我们提出一种基于编码器-解码器结构的新型深度多分支聚合网络(称为 DMA-Net),用于街景中的实时语义分割。具体而言,我们首先采用 ResNet-18 作为编码器,从不同卷积阶段高效生成各级特征图。然后,我们开发多分支聚合网络(MAN)作为解码器,以有效聚合不同层级特征图并捕获多尺度信息。在 MAN 中,设计了一种晶格增强残差块,利用晶格结构增强网络的特征表示。同时,引入特征变换块,在特征聚合前显式变换邻分支的特征图。此外,使用全局上下文块来利用全局上下文信息。这些关键组件紧密组合并在统一网络中联合优化。在具有挑战性的 Cityscapes 和 CamVid 数据集上的大量实验结果表明,我们提出的 DMA-Net 仅使用单块 NVIDIA GTX 1080Ti GPU,分别以 46.7 FPS 和 119.8 FPS 的推理速度取得 77.0% 和 73.6% 的平均交并比(mIoU)。这表明 DMA-Net 在街景语义分割中于分割质量与速度间提供了良好权衡。

关键词

引用

@article{arxiv.2203.04037,
  title  = {Deep Multi-Branch Aggregation Network for Real-Time Semantic Segmentation in Street Scenes},
  author = {Xi Weng and Yan Yan and Genshun Dong and Chang Shu and Biao Wang and Hanzi Wang and Ji Zhang},
  journal= {arXiv preprint arXiv:2203.04037},
  year   = {2022}
}