中文

TR2M:利用语言描述和双层级尺度导向对比将单目相对深度传递至度量深度

计算机视觉与模式识别 2026-03-20 v2

摘要

本工作提出了一种可泛化的框架,用于将相对深度传递至度量深度。当前单目深度估计方法主要分为度量深度估计(MMDE)和相对深度估计(MRDE)。MMDE 以度量尺度估计深度,但通常局限于特定领域。MRDE 在不同领域间泛化良好,但尺度不确定,阻碍了下游应用。为此,我们旨在构建一个框架以解决尺度不确定性并将相对深度传递至度量深度。先前的使用方法作为输入并估计两个因子来进行重缩放。我们的方法 TR2M 同时利用文本描述和图像作为输入,并估计两个重缩放图以在像素级别将相对深度传递至度量深度。两种模态的特征通过跨模态注意力模块进行融合,以更好地捕捉尺度信息。设计了一种策略来构建和过滤可靠的伪度量深度以实现更全面的监督。我们还开发了尺度导向对比学习,利用深度分布作为指导来强制模型学习与尺度分布一致的内在知识。TR2M 仅利用少量可训练参数在多个领域的数据集上进行训练,实验不仅展示了 TR2M 在已有数据集上的优异性能,还揭示了其在五个未见数据集上的优越零样本能力。我们展示了在语言辅助下逐像素地将相对深度传递至度量深度的巨大潜力。(代码可在 https://github.com/BeileiCui/TR2M 获取)

关键词

引用

@article{arxiv.2506.13387,
  title  = {TR2M: Transferring Monocular Relative Depth to Metric Depth with Language Descriptions and Dual-Level Scale-Oriented Contrast},
  author = {Beilei Cui and Yiming Huang and Long Bai and Hongliang Ren},
  journal= {arXiv preprint arXiv:2506.13387},
  year   = {2026}
}

备注

CVPR 2026