中文

RGB-D 图像语义分割的约束参数提议与池化方法

计算机视觉与模式识别 2014-08-01 v2

摘要

我们关注基于 RGB-D 数据的语义分割问题,重点分析包含许多视觉类别中多个实例的杂乱室内场景。我们的方法基于一种参数化的图 - 底强度和深度约束提议过程,该过程在图像的多个位置和尺度生成空间布局假设,随后通过顺序推断算法将提议整合为完整的场景估计。我们的贡献可总结为提出以下内容:(1) 推广参数化最大流图 - 底提议方法以利用强度和深度信息,从而在多项式时间内系统且高效地生成底层空间模型的断点;(2) 基于对利用强度和深度通道构建的多种特征进行二阶池化的新区域描述方法;(3) 一种能够解决重叠空间分区冲突的推断过程,并处理包含大量不同尺度物体类别实例的场景;(4) 在一个具有 92 个类别的高难度 RGB-D 语义分割问题中,广泛评估了深度的影响,以及大量预设计和通过深度学习自动获得的描述符的有效性。我们在具有挑战性的 NYU Depth v2 数据集(扩展用于 RMRC 2013 室内分割挑战)中报告了最先进 (SOTA) 的结果,目前所提出的模型排名第一,平均得分为 24.61%,并在 39 个类别中获胜。此外,我们表明,通过结合二阶特征和深度学习特征,可以额外实现超过 15% 的相对精度提升。在场景分类基准测试中,我们的方法进一步将最先进水平提高了 24%。

关键词

引用

@article{arxiv.1312.7715,
  title  = {Constrained Parametric Proposals and Pooling Methods for Semantic Segmentation in RGB-D Images},
  author = {Dan Banica and Cristian Sminchisescu},
  journal= {arXiv preprint arXiv:1312.7715},
  year   = {2014}
}