中文

水下单目度量深度估计:真实世界基准与基于视觉基础模型的合成微调

计算机视觉与模式识别 2025-07-11 v2

摘要

单目深度估计最近已超越序数深度,能够提供度量深度预测。然而,由于光衰减和散射、颜色失真、浑浊度以及缺乏高质量的度量真值数据,其在水下环境中的可靠性仍然有限。在本文中,我们在带有度量深度注释的真实世界水下数据集(包括 FLSea 和 SQUID)上,对零样本和微调的单目度量深度估计模型进行了全面基准测试。我们在一系列水下条件和深度范围内评估了多种最先进的视觉基础模型。我们的结果表明,在陆地数据(真实或合成)上训练的大规模模型在空气中有效,但由于显著的域偏移,在水下表现不佳。为了解决这个问题,我们使用基于物理的水下图像形成模型模拟了 Hypersim 数据集的水下合成变体,并以此对带有 ViT-S 主干编码器的 Depth Anything V2 进行了微调。我们的微调模型在所有基准测试中均持续提升性能,并优于仅在干净空气 Hypersim 数据集上训练的基线模型。本研究对水下场景中的单目度量深度估计进行了详细的评估和可视化,强调了在挑战性环境中使用基础模型实现鲁棒且可泛化的度量深度预测时,域适应和尺度感知监督的重要性。

关键词

引用

@article{arxiv.2507.02148,
  title  = {Underwater Monocular Metric Depth Estimation: Real-World Benchmarks and Synthetic Fine-Tuning with Vision Foundation Models},
  author = {Zijie Cai and Christopher Metzler},
  journal= {arXiv preprint arXiv:2507.02148},
  year   = {2025}
}