中文

百层提拉米苏:用于语义分割的全卷积 DenseNets

计算机视觉与模式识别 2017-11-01 v3

摘要

语义图像分割的最先进方法建立在卷积神经网络(CNN)之上。典型的分割架构由以下部分组成:(a) 负责提取粗略语义特征的下采样路径,随后是 (b) 训练用于在模型输出处恢复输入图像分辨率的上采样路径,以及可选的 (c) 用于细化模型预测的后处理模块(例如条件随机场)。最近,一种新的 CNN 架构,密集连接卷积网络(DenseNets),在图像分类任务中显示出优异的结果。DenseNets 的思想基于这样一个观察:如果每层以前馈方式直接连接到其他每一层,那么网络将更准确且更易于训练。在本文中,我们扩展了 DenseNets 以处理语义分割问题。我们在 CamVid 和 Gatech 等城市场景基准数据集上取得了最先进的结果,无需任何进一步的后处理模块或预训练。此外,由于模型的巧妙构造,我们的方法比这些数据集当前已发表的最佳条目具有少得多的参数。复现实验的代码可在此处获取:https://github.com/SimJeg/FC-DenseNet/blob/master/train.py

关键词

引用

@article{arxiv.1611.09326,
  title  = {The One Hundred Layers Tiramisu: Fully Convolutional DenseNets for Semantic Segmentation},
  author = {Simon Jégou and Michal Drozdzal and David Vazquez and Adriana Romero and Yoshua Bengio},
  journal= {arXiv preprint arXiv:1611.09326},
  year   = {2017}
}