RedNet:用于室内 RGB-D 语义分割的残差编解码网络
计算机视觉与模式识别
2018-08-07 v2
摘要
室内语义分割一直是计算机视觉中的难题。本文提出一种名为 RedNet 的 RGB-D 残差编解码架构,用于室内 RGB-D 语义分割。在 RedNet 中,残差模块作为基本构建块应用于编码器和解码器,并使用跳跃连接绕过编码器与解码器之间的空间特征。为了融入场景的深度信息,构建了融合结构,该结构对 RGB 图像和深度图像分别进行推理,并在多个层级上融合它们的特征。为了高效优化网络参数,我们提出一种“金字塔监督”训练方案,在解码器的不同层施加监督学习,以应对梯度消失问题。实验结果表明,所提出的 RedNet(ResNet-50)在 SUN RGB-D 基准数据集上取得了 47.8% 的 SOTA mIoU 精度。
引用
@article{arxiv.1806.01054,
title = {RedNet: Residual Encoder-Decoder Network for indoor RGB-D Semantic Segmentation},
author = {Jindong Jiang and Lunan Zheng and Fei Luo and Zhijun Zhang},
journal= {arXiv preprint arXiv:1806.01054},
year = {2018}
}