中文

神经 RGB->D 感知:从视频相机获取深度与不确定性

计算机视觉与模式识别 2019-01-10 v1

摘要

深度感知对于 3D 重建与场景理解至关重要。主动深度传感器提供稠密度量测量,但常受限于作用范围有限、空间分辨率低、传感器干扰及高功耗等问题。本文提出一种深度学习(DL)方法,从单目视频流中连续估计逐像素深度及其不确定性,旨在将 RGB 相机有效转变为 RGB-D 相机。与先前基于 DL 的方法不同,我们为每个像素估计深度概率分布而非单一深度值,从而对每帧输入得到 3D 深度概率体的估计。随着更多帧被顺序处理,这些深度概率体在贝叶斯滤波框架下随时间累积,有效降低深度不确定性并提升精度、鲁棒性与时间稳定性。相较已有工作,所提方法获得更准确稳定的结果,并对新数据集泛化更好。实验结果还表明,我们的方法输出可直接送入经典的基于 RGB-D 的 3D 扫描方法以进行 3D 场景重建。

关键词

引用

@article{arxiv.1901.02571,
  title  = {Neural RGB->D Sensing: Depth and Uncertainty from a Video Camera},
  author = {Chao Liu and Jinwei Gu and Kihwan Kim and Srinivasa Narasimhan and Jan Kautz},
  journal= {arXiv preprint arXiv:1901.02571},
  year   = {2019}
}