中文

PatchRefiner V2:快速轻量的实域高分辨率深度估计

计算机视觉与模式识别 2025-01-03 v1

摘要

当前高分辨率深度估计方法虽取得显著成绩,却因依赖重型模型和多步骤推理而在计算效率上受限,导致推理时间较长。为此,我们引入 PatchRefiner V2 (PRV2),用轻量级编码器取代重型 refine 模型。这既减少了模型规模和推理时间,又引入了噪声特征。为此,我们提出一种粗到精(C2F)模块,集成 Guided Denoising Unit 用于细化和去噪 refine 特征,同时通过 Noisy Pretraining 策略预训练 refine 分支,以充分发挥轻量级 refine 分支的潜能。此外,我们引入 Scale-and-Shift Invariant Gradient Matching (SSIGM) loss 以增强合成到真实域的迁移。PRV2 在 UnrealStereo4K 上在准确率和速度方面均优于最新深度估计方法,参数更少,推理更快。它在 CityScape、ScanNet++ 和 KITTI 等真实世界数据集上改善了深度边界描绘,展示了其在跨域中的多样性。

关键词

引用

@article{arxiv.2501.01121,
  title  = {PatchRefiner V2: Fast and Lightweight Real-Domain High-Resolution Metric Depth Estimation},
  author = {Zhenyu Li and Wenqing Cui and Shariq Farooq Bhat and Peter Wonka},
  journal= {arXiv preprint arXiv:2501.01121},
  year   = {2025}
}