中文

SegNet:一种用于鲁棒语义逐像素标注的深度卷积编码器-解码器架构

计算机视觉与模式识别 2015-05-28 v1

摘要

我们提出一种新颖的深度架构SegNet,用于语义逐像素图像标注。SegNet有几个吸引人的性质;(i)它仅需完全学习函数的前向评估来获得平滑的标注预测,(ii)随着深度增加,为像素标注考虑更大的上下文,提高准确性,(iii)易于在任何深度可视化特征激活在像素标注空间中的效果。SegNet由一堆编码器后接相应的解码器堆组成,解码器堆输入到soft-max分类层。解码器有助于将编码器堆输出的低分辨率特征图映射到全输入图像尺寸特征图。这解决了近期深度学习方法中一个重要的缺陷,这些方法采用为对象分类设计的网络进行逐像素标注。这些方法缺乏将深层特征图映射到输入维度的机制。它们求助于临时方法对特征进行上采样,例如通过复制。这导致噪声预测,并且为了避免过多上采样而限制了池化层数量,从而减少了空间上下文。SegNet通过学习将编码器输出映射到图像像素标注克服了这些问题。我们在来自CamVid、KITTI的户外RGB场景和来自NYU数据集的室内场景测试SegNet性能。我们的结果表明,即使不使用深度、视频帧或CRF模型后处理等额外线索,SegNet也达到最先进性能。

关键词

引用

@article{arxiv.1505.07293,
  title  = {SegNet: A Deep Convolutional Encoder-Decoder Architecture for Robust Semantic Pixel-Wise Labelling},
  author = {Vijay Badrinarayanan and Ankur Handa and Roberto Cipolla},
  journal= {arXiv preprint arXiv:1505.07293},
  year   = {2015}
}

备注

This version was first submitted to CVPR' 15 on November 14, 2014 with paper Id 1468. A similar architecture was proposed more recently on May 17, 2015, see http://arxiv.org/pdf/1505.04366.pdf