Depth Anywhere:通过视角蒸馏和无标签数据增强提升 360 度单目深度估计
计算机视觉与模式识别
2024-10-31 v2
摘要
准确估计 360 度图像的深度对于虚拟现实、自动导航和沉浸式媒体应用至关重要。现有针对视角图像设计的深度估计方法由于不同相机投影和畸变,在应用于 360 度图像时效果不佳;而 360 度方法因缺乏标记数据对效果不佳。我们提出一种新框架有效利用无标签 360 度数据。该方法以最先进的视角深度估计模型为教师模型,通过六面体投影技术生成伪标签,实现对 360 度图像深度的高效标注。这一方法利用大规模数据集的日益增长。我们的方案包括两个主要阶段:离线无效区域掩码生成和在线半监督联合训练。我们在基准数据集(如 Matterport3D 和 Stanford2D3D)上进行测试,显示深度估计精度显著提升,尤其在零样态情景下。我们提出的训练管道可增强任何 360 度单目深度估计器,并在不同相机投影和数据类型之间实现有效知识迁移。详见项目页面:https://albert100121.github.io/Depth-Anywhere/。
引用
@article{arxiv.2406.12849,
title = {Depth Anywhere: Enhancing 360 Monocular Depth Estimation via Perspective Distillation and Unlabeled Data Augmentation},
author = {Ning-Hsu Wang and Yu-Lun Liu},
journal= {arXiv preprint arXiv:2406.12849},
year = {2024}
}
备注
NeurIPS 2024. Project page: https://albert100121.github.io/Depth-Anywhere/