中文

用于大图像语义分割的高效阶梯式 DenseNet

计算机视觉与模式识别 2019-05-15 v1

摘要

深度图像分类模型的最新进展为提升相关计算机视觉任务的最先进水平提供了巨大潜力。然而,向语义分割的过渡受到当代 GPU 严格内存限制的阻碍。卷积反向传播所需的特徵图缓存规模即使对于中等尺寸的 Pascal 图像也带来显著挑战,而在源分辨率为百万像素级别时则需要谨慎的架构考量。为解决这些问题,我们提出了一种新颖的基于 DenseNet 的阶梯式架构,其具有高建模能力和极精简的上采样数据通路。我们还提出通过利用 DenseNet 特徵提取器固有的空间效率来大幅减少特徵图缓存的规模。所得模型以比竞争方法更少的参数实现了高性能,并允许在商用硬件上以百万像素分辨率进行训练。所呈现的实验结果在 Cityscapes、Pascal VOC 2012、CamVid 和 ROB 2018 数据集上的预测精度和执行速度方面均优于最先进水平。源代码将在发表后发布。

关键词

引用

@article{arxiv.1905.05661,
  title  = {Efficient Ladder-style DenseNets for Semantic Segmentation of Large Images},
  author = {Ivan Krešo and Josip Krapac and Siniša Šegvić},
  journal= {arXiv preprint arXiv:1905.05661},
  year   = {2019}
}

备注

12 pages, 6 figures, under review