中文

利用游戏引擎数据集从语义分割预测深度

计算机视觉与模式识别 2021-06-30 v1 机器学习 机器人学

摘要

深度感知是机器人理解周围环境的基础。从认知神经科学视角,视觉深度感知方法分为三类:双目、主动与图像式。前两类已被详细研究数十年。然而,第三类的探索研究仍处于起步阶段,并因近年来深度学习方法的出现而获得发展动力。在认知神经科学中,已知图像式深度感知机制依赖于对所视物体的感知。受此事实启发,本文中我们研究了物体感知与深度估计卷积神经网络之间的关系。为此,我们基于仅以单幅图像为输入的简单深度估计网络开发了新网络结构。我们提出的结构以图像及其语义标签作为网络输入。我们将语义标签用作物体感知的输出。所开发网络与原网络性能比较的结果表明,在考察案例中,我们的新结构能将深度估计性能提升 52% 的距离相对误差。多数实验研究在游戏引擎生成的合成数据集上进行,以将性能比较与真实(非合成)数据集不准确深度与语义标签的影响隔离。研究表明,在缺乏合适数据集的情况下,特定合成数据集可用于深度网络的训练。此外,我们表明在此类情况下,语义标签的使用提升了网络对从合成训练数据到非合成测试数据的域偏移的鲁棒性。

关键词

引用

@article{arxiv.2106.15257,
  title  = {Predicting Depth from Semantic Segmentation using Game Engine Dataset},
  author = {Mohammad Amin Kashi},
  journal= {arXiv preprint arXiv:2106.15257},
  year   = {2021}
}

备注

79 pages, Master's thesis at K. N. Toosi University of Technology, supervised by Professor Hamid D. Taghirad