DA${}^2$:任意方向的深度信息
计算机视觉与模式识别
2025-11-11 v5
摘要
全景图像拥有完整视场(360180),提供比透视图像更完整的视觉描述。得益于这一特性,全景深度估计正日益受到 3D 视觉领域的关注。然而,由于全景数据的稀缺,先前方法往往局限于特定域设置,导致零样本泛化效果差。此外,由于全景图像中固有的球面畸变,许多方法依赖透视分割(如立方体图),这会导致效率 suboptimal。为此,我们提出了 :epth nything in ny irection,一个准确、零样本可泛化且完全端到端的全景深度估计器。具体而言,为扩大全景数据规模,我们引入了一个数据 curation 引擎,用于从透视图像生成高质量的全景深度数据,创建约54.3万对全景 RGB-深度配对,总计约60.7万对。为进一步缓解球面畸变,我们提出了 SphereViT,显式地利用球面坐标来强制全景图像特征中的球面几何一致性,从而提升性能。在多个数据集上进行的全面基准测试清晰地表明,DA 在性能上实现了 SoTA,AbsRel 平均提升了最强大的零样本基线的 38%。意外的是,DA 甚至超过了以往的领域内方法,凸显了其卓越的零样本泛化能力。而且,作为一种端到端解决方案,DA 在融合类方法的效率上具有显著优势。我们已发布代码和精选的全景数据。项目页面:https://depth-any-in-any-dir.github.io/。
引用
@article{arxiv.2509.26618,
title = {DA$^{2}$: Depth Anything in Any Direction},
author = {Haodong Li and Wangguangdong Zheng and Jing He and Yuhao Liu and Xin Lin and Xin Yang and Ying-Cong Chen and Chunchao Guo},
journal= {arXiv preprint arXiv:2509.26618},
year = {2025}
}
备注
Work primarily done during an internship at Tencent Hunyuan. Project page: https://depth-any-in-any-dir.github.io/