中文

通过融合由光流到深度的提议进行视频深度估计

计算机视觉与模式识别 2020-03-04 v2

摘要

来自单目视频的深度可使数十亿设备和机器人借助单个摄像头以三维方式感知世界。本文提出一种带有可微分光流到深度层的视频深度估计方法。该模型由一个光流到深度层、一个相机位姿精化模块和一个深度融合网络组成。给定光流与相机位姿,我们的光流到深度层通过显式求解对极几何优化问题来生成深度提议及相应的置信度图。我们的光流到深度层是可微分的,因此我们可以通过在相机位姿精化模块中最大化聚合置信度来精化相机位姿。我们的深度融合网络可利用由不同相邻帧推断出的深度提议及其置信度图来生成最终深度图。此外,深度融合网络还可额外纳入其他方法生成的深度提议以进一步改善结果。在三个公开数据集上的实验表明,我们的方法优于当前最优(state-of-the-art)深度估计方法,并具有合理的跨数据集泛化能力:我们在 KITTI 上训练的模型在未见过的 Waymo 数据集上仍表现良好。

关键词

引用

@article{arxiv.1912.12874,
  title  = {Video Depth Estimation by Fusing Flow-to-Depth Proposals},
  author = {Jiaxin Xie and Chenyang Lei and Zhuwen Li and Li Erran Li and Qifeng Chen},
  journal= {arXiv preprint arXiv:1912.12874},
  year   = {2020}
}