Depth Any Camera:来自任意相机的零样态度深度估计
计算机视觉与模式识别
2025-03-18 v2 人工智能
机器人学
摘要
虽然最近的深度基础模型在零样态推理方面表现出强大能力,但在实现跨各种相机类型的准确度量深度估计——尤其是大视场 (FoV) 的相机,如鱼眼和 360 度相机——仍面临重大挑战。本文提出了 Depth Any Camera (DAC),一个强大的零样态度度深度估计框架,将训练时基于透视的模型扩展到有效处理具有不同 FoV 的相机。该框架旨在确保无论在新应用程序中使用何种特定相机类型,都可以有效利用所有现有 3D 数据。值得注意的是,DAC 仅在透视图像上进行训练,却能无需专门训练数据地自然地推广到鱼眼和 360 度相机。DAC 采用等距矩形投影 (ERP) 作为统一的图像表示,实现对不同 FoV 图像的一致处理。其核心组件包括基于 pitch 的图像到 ERP 转换,利用高效在线数据增强来模拟来自未失真输入的扭曲 ERP 块面板、FoV 对齐操作以有效覆盖各种 FoV 的训练,以及多分辨率数据增强进一步解决训练和测试之间的分辨率差异。DAC 在多个鱼眼和 360 度数据集上实现了零样态度深度估计的最新成果,较先前的度量深度基础模型在 精度上提升了最高 50%,显示现实推广能力跨相机类型。
引用
@article{arxiv.2501.02464,
title = {Depth Any Camera: Zero-Shot Metric Depth Estimation from Any Camera},
author = {Yuliang Guo and Sparsh Garg and S. Mahdi H. Miangoleh and Xinyu Huang and Liu Ren},
journal= {arXiv preprint arXiv:2501.02464},
year = {2025}
}