中文

Depth2Pose:一种无需真值深度的基于位姿的单目深度估计基准

计算机视觉与模式识别 2026-05-20 v1

摘要

近年来,在日益强大的模型和大规模训练数据的推动下,单目深度估计取得了显著进步。预测深度越来越多地被用作下游任务(如运动恢复结构(SfM)、视觉定位和SLAM)的输入信号。然而,单目深度估计器(MDE)的评估仍主要基于深度精度。标准指标会全局聚合误差,可能无法反映深度对下游几何任务的有用性。因此,我们提出了Depth2Pose,一个在下游任务背景下评估MDE的框架。通过在深度感知几何求解器中结合深度预测与特征对应关系,我们使用相对相机位姿估计精度作为深度质量的任务驱动代理指标。传统基准需要密集的逐像素深度真值,获取成本高昂。相比之下,我们的公式仅需要相机位姿,这些位姿可以高效估计,例如使用运动恢复结构流程。因此,我们的框架可应用于难以获取深度真值的场景,例如由于场景尺度大或存在严重遮挡(如植被环境)。利用这一点,我们引入了D2P数据集,其中包含超出常用训练数据分布的挑战性场景。我们表明,在现有基准上标准深度误差指标下表现良好的方法,在相同数据集上使用我们基于位姿的指标评估时也表现良好,但不一定能泛化到我们更具挑战性的数据集。最后,我们提供了一个简单且可扩展的评估框架。数据集和代码可在kocurvik.github.io/depth2pose获取。

关键词

引用

@article{arxiv.2605.19797,
  title  = {Depth2Pose: A Pose-Based Benchmark for Monocular Depth Estimation without Ground-Truth Depth},
  author = {Viktor Kocur and Sithu Aung and Gabrielle Flood and Yaqing Ding and Lukas Bujnak and Torsten Sattler and Zuzana Kukelova},
  journal= {arXiv preprint arXiv:2605.19797},
  year   = {2026}
}