中文

UniDepth:通用单目度量深度估计

计算机视觉与模式识别 2024-03-29 v1

摘要

精确的单目度量深度估计(MMDE)对于解决3D感知与建模中的下游任务至关重要。然而,近期MMDE方法的显著精度仅局限于其训练域。这些方法即使在存在适度域差距时也无法泛化到未见域,这阻碍了其实用性。我们提出了一种新模型 UniDepth,能够仅凭单张图像跨域重建度量3D场景。不同于现有的MMDE方法,UniDepth在推理时直接从输入图像预测度量3D点,无需任何额外信息,力求成为一种通用且灵活的MMDE解决方案。具体而言,UniDepth实现了一个自提示相机模块,预测密集相机表示以调节深度特征。我们的模型利用伪球面输出表示,解耦了相机与深度表示。此外,我们提出了一种几何不变性损失,以促进相机提示深度特征的不变性。在零样本机制下对十个数据集的全面评估一致证明了 UniDepth 的优越性能,即使与直接在测试域上训练的方法相比也是如此。代码和模型可在:https://github.com/lpiccinelli-eth/unidepth 获取

关键词

引用

@article{arxiv.2403.18913,
  title  = {UniDepth: Universal Monocular Metric Depth Estimation},
  author = {Luigi Piccinelli and Yung-Hsu Yang and Christos Sakaridis and Mattia Segu and Siyuan Li and Luc Van Gool and Fisher Yu},
  journal= {arXiv preprint arXiv:2403.18913},
  year   = {2024}
}