SegNet:一种用于图像分割的深度卷积编码器-解码器架构
计算机视觉与模式识别
2016-10-12 v3 机器学习
神经与进化计算
摘要
我们提出一种新颖且实用的深度全卷积神经网络架构,用于语义像素级分割,称为 SegNet。该核心可训练分割引擎由编码器网络、相应的解码器网络以及后续的像素级分类层组成。编码器网络的架构在拓扑上与 VGG16 网络中的 13 个卷积层相同。解码器网络的作用是将低分辨率编码器特征图映射到全输入分辨率特征图以进行像素级分类。SegNet 的新颖性在于解码器上采样其低分辨率输入特征图的方式。具体而言,解码器使用在相应编码器的最大池化步骤中计算的池化索引来执行非线性上采样。这消除了学习上采样的需要。上采样后的图是稀疏的,随后与可训练滤波器卷积以产生稠密特征图。我们将提出的架构与广泛采用的 FCN 以及知名的 DeepLab-LargeFOV、DeconvNet 架构进行比较。该比较揭示了实现良好分割性能所涉及的内存与精度权衡。SegNet 主要受场景理解应用驱动。因此,其设计在推理时的内存与计算时间方面均高效。其可训练参数数量也显著少于其他竞争架构。我们还在道路场景与 SUN RGB-D 室内场景分割任务上对 SegNet 及其他架构进行了受控基准测试。我们表明,与其他架构相比,SegNet 以具竞争力的推理时间和更高效的内存推理提供了良好性能。我们还提供了 SegNet 的 Caffe 实现及网页演示 http://mi.eng.cam.ac.uk/projects/segnet/。
引用
@article{arxiv.1511.00561,
title = {SegNet: A Deep Convolutional Encoder-Decoder Architecture for Image Segmentation},
author = {Vijay Badrinarayanan and Alex Kendall and Roberto Cipolla},
journal= {arXiv preprint arXiv:1511.00561},
year = {2016}
}