中文

STD2P:基于时空数据驱动池化的RGBD语义分割

计算机视觉与模式识别 2017-04-27 v3

摘要

我们提出了一种新颖的基于超像素的多视角卷积神经网络用于语义图像分割。该网络通过利用同一场景的额外视角信息,生成单幅图像的高质量分割。特别是在由机器人平台或手持、穿戴式RGBD相机捕捉的室内视频中,邻近视频帧提供了多样的视角以及物体和场景的额外上下文。为利用此类信息,我们首先通过光流和基于图像边界的超像素计算区域对应关系。给定这些区域对应关系,我们提出一种新颖的时空池化层来聚合空间和时间上的信息。我们在NYU--Depth--V2和SUN3D数据集上评估了我们的方法,并将其与各种最先进的单视角和多视角方法进行比较。除了相对于最先进方法的整体改进外,我们还展示了在训练期间利用未标记帧对多视角以及单视角预测的好处。

关键词

引用

@article{arxiv.1604.02388,
  title  = {STD2P: RGBD Semantic Segmentation Using Spatio-Temporal Data-Driven Pooling},
  author = {Yang He and Wei-Chen Chiu and Margret Keuper and Mario Fritz},
  journal= {arXiv preprint arXiv:1604.02388},
  year   = {2017}
}

备注

To appear in CVPR 2017