用于场景解析的深度反卷积网络
机器学习
2014-11-18 v1 计算机视觉与模式识别
机器学习
摘要
场景解析是计算机视觉中一个重要且具有挑战性的问题。它要求用所属类别标记图像中的每个像素。传统上,该问题是通过利用图像颜色信息的手工设计特征来解决的。最近,能够自动学习特征层次结构的卷积神经网络(CNNs)在该任务上取得了创纪录的性能。这些方法通常包括后处理技术(如超像素)以生成最终标记。在本文中,我们提出了一种结合深度反卷积神经网络与 CNNs 的新型网络架构。实验表明,与 CNNs 相比,反卷积神经网络能够学习超越边缘基元的高阶图像结构。该新网络架构被用于本工作引入的多块训练(multi-patch training)。多块训练使得能够有效地从场景中学习空间先验。所提出的方法在四个场景解析数据集(即 Stanford Background、SIFT Flow、CamVid 和 KITTI)上产生了最先进的性能。此外,我们的系统还具有额外优势,即拥有一个可以完全自动化端到端训练的系统,无需任何后处理。
引用
@article{arxiv.1411.4101,
title = {Deep Deconvolutional Networks for Scene Parsing},
author = {Rahul Mohan},
journal= {arXiv preprint arXiv:1411.4101},
year = {2014}
}