中文

BridgeDepth:通过潜在对齐桥接单目与立体深度推理

计算机视觉与模式识别 2025-08-14 v2 机器人学

摘要

单目深度估计和立体深度估计各自拥有互补的优势:单目方法捕获丰富的上下文先验但缺乏几何精度,而立体方法利用焦线几何但在诸如反射或无纹理表面等歧义情况方面难以应对。尽管存在事后协同作用,但这些范式在实际中仍基本是各自为独的。我们引入了一个统一框架,通过其潜在表示的双向对齐来实现两者的桥接。在其核心,一种新颖的跨注意力对齐机制在立体推理期间动态地同步单目上下文线索与立体假设表示。这种相互对齐通过注入单目结构先验来解决立体歧义(例如镜面表面),同时在单个网络中以立体几何细化单目深度。广泛的实验表明,该方法实现了最先进的性能:\textbf{在 Middlebury 和 ETH3D 上将 zero-shot 泛化误差降低超过 40\%},并解决了对透明和反射表面的长期问题。通过将多视图几何与单目上下文融合,本方法实现超越 modality-specific 限制的稳健三维感知。代码已公开于 https://github.com/aeolusguan/BridgeDepth。

关键词

引用

@article{arxiv.2508.04611,
  title  = {BridgeDepth: Bridging Monocular and Stereo Reasoning with Latent Alignment},
  author = {Tongfan Guan and Jiaxin Guo and Chen Wang and Yun-Hui Liu},
  journal= {arXiv preprint arXiv:2508.04611},
  year   = {2025}
}

备注

ICCV 2025 Highlight