Depth Anything V2
计算机视觉与模式识别
2024-10-22 v2
摘要
本文提出了Depth Anything V2。我们无意追求花哨的技术,而是旨在揭示关键发现,为构建强大的单目深度估计模型铺平道路。值得注意的是,与V1相比,本版本通过三个关键实践产生了更精细、更鲁棒的深度预测:1)将所有带标注的真实图像替换为合成图像;2)扩大教师模型的容量;3)通过大规模伪标注真实图像作为桥梁来教导学生模型。与基于Stable Diffusion的最新模型相比,我们的模型效率显著更高(速度快10倍以上)且精度更高。我们提供了不同规模(参数从25M到1.3B不等)的模型,以支持广泛的应用场景。凭借其强大的泛化能力,我们使用度量深度标签对其进行微调,以获得度量深度模型。除了我们的模型之外,考虑到当前测试集多样性有限且噪声频繁,我们构建了一个具有精确标注和多样化场景的多功能评估基准,以促进未来的研究。
引用
@article{arxiv.2406.09414,
title = {Depth Anything V2},
author = {Lihe Yang and Bingyi Kang and Zilong Huang and Zhen Zhao and Xiaogang Xu and Jiashi Feng and Hengshuang Zhao},
journal= {arXiv preprint arXiv:2406.09414},
year = {2024}
}
备注
Accepted by NeurIPS 2024. Project page: https://depth-anything-v2.github.io