基于视觉-惯性SLAM的深度估计
计算机视觉与模式识别
2020-08-18 v2
摘要
本文研究从室内场景的稀疏深度点与图像中学习补全场景深度的问题。具体地,我们研究稀疏深度由视觉-惯性同步定位与建图(VI-SLAM)系统计算得到的情况。与主动深度传感器(如 LiDAR 或 Kinect)的输入相比,所得点云密度低、含噪声且空间分布不均匀。由于 VI-SLAM 仅在纹理区域产生点云,我们利用低纹理表面的平面结构及其表面法线(一种重要的中间表示)来补偿缺失深度。然而,预训练的表面法线网络在测试图像与训练图像的视角方向(尤其是滚转角)差异显著时性能大幅下降。为克服该局限,我们利用 VI-SLAM 提供的重力估计将输入图像扭曲至训练数据集中占主导的方向。这显著提升了表面法线估计及由此得到的稠密深度估计性能。最后,我们表明该方法在训练集(ScanNet 和 NYUv2)和测试集(使用 Azure Kinect 采集)上均优于其他 SOTA 方法。
引用
@article{arxiv.2008.00092,
title = {Deep Depth Estimation from Visual-Inertial SLAM},
author = {Kourosh Sartipi and Tien Do and Tong Ke and Khiem Vuong and Stergios I. Roumeliotis},
journal= {arXiv preprint arXiv:2008.00092},
year = {2020}
}
备注
9 pages