中文

Depth Anything 3:从任意视角恢复视觉空间

计算机视觉与模式识别 2025-11-14 v1

摘要

我们提出 Depth Anything 3 (DA3),一个模型,从任意数量的视觉输入(无论是否已知相机姿态)预测空间一致的几何。为实现最小建模,DA3 提出两个关键洞察:单个普通变换器(如 vanilla DINO 编码器)作为 backbone 足以,无需特定的架构专门化;单一深度射线预测目标消除了复杂多任务学习的需求。通过我们的教师-学生训练范式,该模型在细节和泛化性方面达到与 Depth Anything 2 (DA2) 相当的水平。我们建立了一个新的视几何基准,覆盖相机姿态估计、任意视图几何和视觉渲染。在该基准上,DA3 在所有任务上均达到最新状态,平均以相机姿态精度提高 44.3%、几何精度提高 25.1%。此外,它在单目深度估计中超过 DA2。所有模型仅在公开学术数据集上训练。

关键词

引用

@article{arxiv.2511.10647,
  title  = {Depth Anything 3: Recovering the Visual Space from Any Views},
  author = {Haotong Lin and Sili Chen and Junhao Liew and Donny Y. Chen and Zhenyu Li and Guang Shi and Jiashi Feng and Bingyi Kang},
  journal= {arXiv preprint arXiv:2511.10647},
  year   = {2025}
}

备注

https://depth-anything-3.github.io/