AnyDepth: 简化深度估计
计算机视觉与模式识别
2026-01-07 v1
摘要
单目深度估计旨在从二维图像中恢复三维场景的深度信息。虽然近期研究取得了显著进展,但其对大规模数据集和复杂解码器的依赖限制了效率和泛化能力。本文提出了一个轻量级且数据导向的零样本单目深度估计框架。我们首先采用 DINOv3 作为视觉编码器,以获取高质量的稠密特征。其次,针对 DPT 结构复杂的固有缺陷,我们设计了 Simple Depth Transformer (SDT),一种紧凑的基于Transformer的解码器。与 DPT 相比,它采用单路径特征融合和上采样流程,显著降低了跨尺度特征融合的计算开销,在保持更高精度的同时,将参数数量降低约 85%-89%。此外,我们提出了基于质量的过滤策略,以过滤有害样本,从而在减小数据集规模的同时提高整体训练质量。在五个基准测试上的大量实验表明,我们的框架在精度上优于 DPT。本工作凸显了在实现高效和通用零样本深度估计方面,平衡模型设计与数据质量的重要性。代码:https://github.com/AIGeeksGroup/AnyDepth。网站:https://aigeeksgroup.github.io/AnyDepth。
引用
@article{arxiv.2601.02760,
title = {AnyDepth: Depth Estimation Made Easy},
author = {Zeyu Ren and Zeyu Zhang and Wukai Li and Qingxiang Liu and Hao Tang},
journal= {arXiv preprint arXiv:2601.02760},
year = {2026}
}