中文

深度基础模型:视觉基深度估计的最新趋势

计算机视觉与模式识别 2025-10-23 v2

摘要

深度估计是 3D 计算机视觉中的基础任务,对于 3D 重建、自由视角渲染、机器人、自动驾驶及 AR/VR 技术等应用至关重要。传统方法依赖 LiDAR 等硬件传感器,常受高成本、低分辨率及环境敏感性限制,难以在实际场景中适用。近期视觉基方法的突破为提供了有前景的替代方案,但由于模型架构容量较低或依赖于领域特定且数据规模有限的数据,仍面临泛化性和稳定性挑战。规模化规律和基础模型在其他领域的兴起,启发了发展“深度基础模型”:在大规模数据集上训练的深度神经网络,具备强大的零样例泛化能力。本文综述了在单目、立体、多视角及单目视频等 setting 下,深度估计相关深度学习架构与范式的最新进展。我们探讨了这些模型如何解决现存挑战,并提供了一份全面的大规模数据集概览,以促进其发展。通过识别关键架构与训练策略,我们旨在揭示构建稳健深度基础模型的路径,为其未来研究与应用提供深入见解。

关键词

引用

@article{arxiv.2507.11540,
  title  = {Towards Depth Foundation Model: Recent Trends in Vision-Based Depth Estimation},
  author = {Zhen Xu and Hongyu Zhou and Sida Peng and Haotong Lin and Haoyu Guo and Jiahao Shao and Peishan Yang and Qinglin Yang and Sheng Miao and Xingyi He and Yifan Wang and Yue Wang and Ruizhen Hu and Yiyi Liao and Xiaowei Zhou and Hujun Bao},
  journal= {arXiv preprint arXiv:2507.11540},
  year   = {2025}
}