中文

VGLD:面向单目深度尺度恢复的视觉引导语言消歧

计算机视觉与模式识别 2025-07-15 v3

摘要

单目深度估计可大致分为两个方向:相对深度估计,预测无绝对尺度的归一化或逆深度;以及度量深度估计,旨在恢复具有真实世界尺度的深度。虽然相对方法灵活且数据高效,但其缺乏度量尺度限制了它们在下游任务中的实用性。一种有前景的解决方案是从文本描述中推断绝对尺度。然而,这种基于语言的恢复对自然语言的歧义性高度敏感,因为同一图像可能因视角和风格不同而被不同地描述。为解决此问题,我们引入了VGLD(视觉引导的语言消歧),这是一个结合高层视觉语义来消除文本输入歧义的框架。通过联合编码图像和文本,VGLD预测一组全局线性变换参数,将相对深度图与绝对尺度对齐。这种视觉引导的消歧提高了尺度估计的稳定性和准确性。我们在代表性模型(包括MiDaS和DepthAnything)上,使用标准室内(NYUv2)和室外(KITTI)基准评估了VGLD。结果表明,VGLD显著减轻了由不一致或歧义语言引起的尺度估计偏差,实现了鲁棒且准确的绝对预测。此外,当在多个数据集上训练时,VGLD可作为一个通用且轻量级的对齐模块,即使在零样本设置下也能保持强大性能。代码将在接收后发布。

关键词

引用

@article{arxiv.2505.02704,
  title  = {VGLD: Visually-Guided Linguistic Disambiguation for Monocular Depth Scale Recovery},
  author = {Bojin Wu and Jing Chen},
  journal= {arXiv preprint arXiv:2505.02704},
  year   = {2025}
}

备注

19 pages, conference