Indoor GeoNet:用于深度与位姿估计的弱监督混合学习
计算机视觉与模式识别
2018-11-20 v1
摘要
人类自然通过累积从场景多个相互关联的投影所获得的信息并解读其对应关系来感知面前的 3D 场景。这一现象启发了人工智能模型通过建模场景不同视图间的对应关系来提取观测场景的深度与视角。本文建立在先前利用深度学习(DL)模型从时间连续视频帧进行无监督深度与相对相机位姿估计的工作之上。我们的方法采用了近期称为 GeoNet 的工作中引入的混合学习框架,该框架利用 3D 场景中的几何约束,从基于 DL 的中间预测深度与相对位姿合成新视图。然而,当前最优的无监督深度与位姿估计 DL 模型仅在少数可用的室外场景数据集上训练/测试,且我们已表明它们很难迁移到新场景,尤其是来自室内环境的场景,其中估计需要更高精度并处理可能的遮挡。本文提出“Indoor GeoNet”,一种面向室内场景的弱监督深度与相机位姿估计模型。在 Indoor GeoNet 中,我们利用由人或机器人导航采集的室内 RGBD 数据集的可用性,在模型中加入深度训练的局部(即弱)监督。实验结果表明,我们的模型能有效泛化到来自不同建筑的新场景。与原始 GeoNet 相比,Indoor GeoNet 在深度与位姿估计误差上显著降低,同时在室内环境新视图合成中展现出 3 倍的重建精度。
引用
@article{arxiv.1811.07461,
title = {Indoor GeoNet: Weakly Supervised Hybrid Learning for Depth and Pose Estimation},
author = {Amirreza Farnoosh and Sarah Ostadabbas},
journal= {arXiv preprint arXiv:1811.07461},
year = {2018}
}