中文

WEDepth:面向单目深度估计的世界知识高效适配

计算机视觉与模式识别 2025-11-12 v1

摘要

单目深度估计(Monocular Depth Estimation, MDE)具有广泛应用前景,但因从单一2D图像重建3D场景本质具有高度难解性,仍备受挑战。现代视觉基础模型(Vision Foundation Models, VFMs)在大规模多样数据集上预训练,展现出卓越的世界理解能力,能从各类视觉任务中受益。最近的研究表明,通过微调这些VFMs可显著提升MDE性能。鼓舞人心的是,这一趋势促使我们提出WEDepth,一种 novel 方法,旨在不修改其结构和预训练权重的前提下适配VFMs用于MDE,同时有效地激发和利用其内在先验知识。我们的方法将VFM作为多层特征增强器,系统性地在不同表示层级注入先验知识。实验在NYU-Depth v2和KITTI数据集上进行,结果表明WEDepth建立了新的最先进(SOTA)性能,实现了对比多次前向传播的扩散方法(需要多次前向传播)和基于相对深度的方法的竞争性结果。此外,我们展示了该方法在各类场景中具有强大的零样本迁移能力。

关键词

引用

@article{arxiv.2511.08036,
  title  = {WEDepth: Efficient Adaptation of World Knowledge for Monocular Depth Estimation},
  author = {Gongshu Wang and Zhirui Wang and Kan Yang},
  journal= {arXiv preprint arXiv:2511.08036},
  year   = {2025}
}