中文

DO3D:从单目视频中自监督学习解耦的物体感知 3D 运动与深度

计算机视觉与模式识别 2024-03-12 v1

摘要

尽管在从单目视频进行自监督深度估计方面取得了相当大的进展,但大多数现有方法通常将视频中的所有物体视为静态实体,然而这违背了真实世界场景的动态本质,并且无法对运动物体的几何结构和运动进行建模。在本文中,我们提出了一种自监督方法,用于从单目视频中联合学习 3D 运动和深度。我们的系统包含一个用于预测深度的深度估计模块,以及一个新的解耦物体感知 3D 运动(DO3D)估计模块,用于预测自运动和 3D 物体运动。深度和运动网络协同工作,忠实地对真实世界场景的几何结构和动力学进行建模,这反过来又有利于深度和 3D 运动估计。它们的预测被进一步组合以合成新的视频帧,用于自监督训练。作为我们框架的核心组件,DO3D 是一个新的运动解耦模块,学习分别预测相机自运动和实例感知的 3D 物体运动。为了缓解估计非刚性 3D 物体运动的困难,将其分解为物体级别的 6-DoF 全局变换和像素级的局部 3D 运动形变场。在包括 KITTI、Cityscapes 和 VKITTI2 在内的三个基准数据集上进行了定性和定量实验,我们的模型在所有评估设置中均表现出卓越的性能。对于深度估计任务,我们的模型在高分辨率设置下优于所有对比的研究工作,在 KITTI 基准上达到了 0.099 的绝对相对深度误差。此外,我们的光流估计结果(在 KITTI 上总体 EPE 为 7.09)也超越了 SOTA 方法,并大大改善了动态区域的估计,证明了我们运动模型的有效性。我们的代码将会公开。

关键词

引用

@article{arxiv.2403.05895,
  title  = {DO3D: Self-supervised Learning of Decomposed Object-aware 3D Motion and Depth from Monocular Videos},
  author = {Xiuzhe Wu and Xiaoyang Lyu and Qihao Huang and Yong Liu and Yang Wu and Ying Shan and Xiaojuan Qi},
  journal= {arXiv preprint arXiv:2403.05895},
  year   = {2024}
}

备注

24 pages, 14 figures, Tech Report