中文

Depth Anything:释放大规模无标签数据的力量

计算机视觉与模式识别 2024-04-09 v2

摘要

本文提出了 Depth Anything,一种用于鲁棒单目深度估计的高度实用解决方案。我们不追求新颖的技术模块,旨在构建一个简单而强大的基础模型,以处理任何情况下的任何图像。为此,我们通过设计一个数据引擎来收集和自动标注大规模无标签数据(约 6200 万),从而扩大了数据覆盖范围,进而能够减少泛化误差。我们研究了两种简单但有效的策略,使数据规模化成为可能。首先,利用数据增强工具创建更具挑战性的优化目标,迫使模型主动寻求额外的视觉知识并获得鲁棒的表示。其次,开发了一种辅助监督机制,强制模型从预训练编码器中继承丰富的语义先验。我们广泛评估了其零样本(zero-shot)能力,包括六个公共数据集和随机拍摄的照片,结果显示其具有令人印象深刻的泛化能力。此外,通过使用来自 NYUv2 和 KITTI 的度量深度信息进行微调,我们确立了新的 SOTA。我们更优的深度模型也带来了更好的深度条件 ControlNet。我们的模型已发布在 https://github.com/LiheYoung/Depth-Anything。

关键词

引用

@article{arxiv.2401.10891,
  title  = {Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data},
  author = {Lihe Yang and Bingyi Kang and Zilong Huang and Xiaogang Xu and Jiashi Feng and Hengshuang Zhao},
  journal= {arXiv preprint arXiv:2401.10891},
  year   = {2024}
}

备注

Accepted by CVPR 2024. Project page: https://depth-anything.github.io