PanDA:基于无标签全景图和莫伊斯空间增强的全景深度学习
计算机视觉与模式识别
2025-03-18 v2
摘要
最近,深度学习模型(DAM)——一种深度基础模型——在各类视角图像上展现出惊人的零样本能力。尽管取得了成功,但DAM 在全景图像上的性能仍是未开问题,这些图像拥有较大的视场(180x360),但受到球面畸变的影响。为解决这一差距,我们进行了经验性分析,评估了DAM在全景图像上的性能并确定其局限性。为此,我们开展了全面的实验来评估DAM从三个关键因素:全景表示、360 相机位置用于捕获场景、以及球面空间变换。通过这种方式,我们揭示了一些关键发现,例如DAM对空间变换较为敏感。随后,我们提出了一个半监督学习(SSL)框架来学习全景DAM,称为 PanDA。在SSL框架下,PanDA首先通过在合成室内和户外全景数据集上进行联合训练来微调DAM,学习到教师模型。然后,在大规模无标签数据上训练学生模型,利用教师模型生成的伪标签。为增强PanDA的泛化能力,提出了基于莫伊斯变换的空间增强(MTSA),用于在原始预测深度图和空间变换后的预测深度图之间施加一致性正则化。这在一定程度上提高了学生模型对各种空间变换的鲁棒性,即使在严重畸变下也能有效。广泛的实验表明,PanDA 在各类场景中展现出惊人的零样本能力,并在两个流行的真实世界基准测试中超越数据特定的全景深度估计方法。
引用
@article{arxiv.2406.13378,
title = {PanDA: Towards Panoramic Depth Anything with Unlabeled Panoramas and Mobius Spatial Augmentation},
author = {Zidong Cao and Jinjing Zhu and Weiming Zhang and Hao Ai and Haotian Bai and Hengshuang Zhao and Lin Wang},
journal= {arXiv preprint arXiv:2406.13378},
year = {2025}
}
备注
16 pages, 18 figures, accepted by CVPR 2025