中文

MonoPP:基于平面视差几何的无监督度量缩放单目深度估计模型

计算机视觉与模式识别 2025-12-05 v1 人工智能 机器学习 机器人学

摘要

自监督单目深度估计 (MDE) 因能直接从视频中获得深度预测而受到关注。然而,这些方法常常产生尺度不变的结果,除非提供额外的训练信号。为此,我们提出一种新颖的自监督度量缩放 MDE 模型,仅需单目视频数据及车辆的安装位置——这两种信息在现代车辆中均可轻易获取。我们的方法利用平面视差几何来重建场景结构。整个管线包括三个主要网络:多帧网络、单帧网络和姿态网络。多帧网络处理连续帧,通过平面视差几何和车辆安装位置来估计静态场景的结构。基于此重建,它作为教师网络向单帧网络传递尺度信息、被遮挡可驾驶区域、度量尺度深度以及动态物体掩码等知识。它还帮助姿态网络预测两个连续图像之间的度量尺度相对姿态。我们的方法在驾驶基准数据集 KITTI 上取得了度量尺度深度预测的状态突破性成绩。值得注意的是,我们是首次在具有挑战性的 Cityscapes 数据集上实现自监督度量尺度深度预测,展示了其有效性和通用性。

关键词

引用

@article{arxiv.2411.19717,
  title  = {MonoPP: Metric-Scaled Self-Supervised Monocular Depth Estimation by Planar-Parallax Geometry in Automotive Applications},
  author = {Gasser Elazab and Torben Gräber and Michael Unterreiner and Olaf Hellwich},
  journal= {arXiv preprint arXiv:2411.19717},
  year   = {2025}
}

备注

Accepted at WACV 25, project page: https://mono-pp.github.io/