中文

Depth Anything V2

计算机视觉与模式识别 2024-10-22 v2

摘要

本文提出了Depth Anything V2。我们无意追求花哨的技术,而是旨在揭示关键发现,为构建强大的单目深度估计模型铺平道路。值得注意的是,与V1相比,本版本通过三个关键实践产生了更精细、更鲁棒的深度预测:1)将所有带标注的真实图像替换为合成图像;2)扩大教师模型的容量;3)通过大规模伪标注真实图像作为桥梁来教导学生模型。与基于Stable Diffusion的最新模型相比,我们的模型效率显著更高(速度快10倍以上)且精度更高。我们提供了不同规模(参数从25M到1.3B不等)的模型,以支持广泛的应用场景。凭借其强大的泛化能力,我们使用度量深度标签对其进行微调,以获得度量深度模型。除了我们的模型之外,考虑到当前测试集多样性有限且噪声频繁,我们构建了一个具有精确标注和多样化场景的多功能评估基准,以促进未来的研究。

关键词

引用

@article{arxiv.2406.09414,
  title  = {Depth Anything V2},
  author = {Lihe Yang and Bingyi Kang and Zilong Huang and Zhen Zhao and Xiaogang Xu and Jiashi Feng and Hengshuang Zhao},
  journal= {arXiv preprint arXiv:2406.09414},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024. Project page: https://depth-anything-v2.github.io