基于RGB-D相机的多视图深度学习一致语义映射
计算机视觉与模式识别
2017-12-06 v2
摘要
视觉场景理解是使机器人能够在环境中有目的行动的一项重要能力。本文中,我们提出一种利用深度学习从多个 RGB-D 视图进行对象类分割的新方法。我们训练一个深度神经网络以半监督方式预测从多个视点一致的对象类语义。在测试时,我们网络的语义预测在语义关键帧地图中比在单个视图上训练的网络预测能更一致地融合。我们的网络架构基于近期用于语义对象类分割的 RGB 与深度融合的单视图深度学习方法,并通过多尺度损失最小化加以增强。我们利用 RGB-D SLAM 获取相机轨迹,并将 RGB-D 图像的预测扭曲至真值标注帧,以在训练期间强制多视图一致性。在测试时,来自多个视图的预测被融合到关键帧中。我们提出并分析了在训练和测试期间强制多视图一致性的几种方法。我们评估了多视图一致性训练的好处,并证明深度特征池化与多视图融合在 NYUDv2 语义分割基准上优于单视图基线。我们的端到端训练网络在 NYUDv2 数据集上的单视图分割以及多视图语义融合方面均达到了最先进的性能。
引用
@article{arxiv.1703.08866,
title = {Multi-View Deep Learning for Consistent Semantic Mapping with RGB-D Cameras},
author = {Lingni Ma and Jörg Stückler and Christian Kerl and Daniel Cremers},
journal= {arXiv preprint arXiv:1703.08866},
year = {2017}
}
备注
the 2017 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2017)