中文

一眼即可:基于分块的零样本高分辨率单目深度估计无缝细化

计算机视觉与模式识别 2025-08-01 v3

摘要

零样本深度估计(DE)模型在大规模数据集上训练后表现出强大的泛化能力。然而,现有模型在高分辨率图像上难以处理,这是由于训练时使用的较小分辨率图像与推理时高分辨率图像之间的分辨率差异所致。在全分辨率上处理图像会导致深度估计精度下降并消耗大量内存,而将其下采样到训练分辨率则会导致估计深度图像边缘模糊。现有的高分辨率深度估计方法采用分块方法,这会在拼接估计深度块时引入深度不连续问题,导致测试时效率低下。此外,为获得细粒度深度细节,这些方法依赖合成数据集,因为现实世界中稀疏的深度 ground truth 较难获得,从而导致泛化性差。为解决这些限制,我们提出了一种高效且通用的瓦片基框架——Patch Refine Once(PRO)。我们的 PRO 包含两个关键组件:(i) 分组分块一致性训练通过在单个反向传播步骤中联合处理四个重叠分块并对其重叠区域施加一致性损失,增强了测试时效率并缓解了深度不连续问题;(ii) 无偏掩码防止 DE 模型对数据集特定偏差过拟合,即使仅在合成数据上训练也能在现实数据集上获得更好的泛化性。在 Booster、ETH3D、Middlebury 2014 和 NuScenes 上的零样本评估表明,我们的 PRO 可以无缝集成到现有的深度估计模型中。

关键词

引用

@article{arxiv.2503.22351,
  title  = {One Look is Enough: Seamless Patchwise Refinement for Zero-Shot Monocular Depth Estimation on High-Resolution Images},
  author = {Byeongjun Kwon and Munchurl Kim},
  journal= {arXiv preprint arXiv:2503.22351},
  year   = {2025}
}

备注

ICCV 2025 (camera-ready version). [Project page](https://kaist-viclab.github.io/One-Look-is-Enough_site)