中文

PatchRefiner:面向实域高分辨率单目度量深度估计的合成数据利用框架

计算机视觉与模式识别 2024-06-12 v1

摘要

本文介绍 PatchRefiner,一个面向高分辨率实域输入的单张图像度量深度估计的高级框架。尽管深度估计在自动驾驶、3D 生成建模和 3D 重建等应用中至关重要,但由于现有架构的限制以及稀缺的详细实域深度数据,实现实验场景下的准确高分辨率深度估计颇具挑战。PatchRefiner 采用基于砖块的方法,重新概念化高分辨率深度估计为一个 refinement 过程,从而实现显著的性能提升。利用 pseudo-labeling 策略利用合成数据,PatchRefiner 融合 Detail and Scale Disentangling (DSD) 损失,以增强细节捕获 while 保持 scale 准确性,从而有效地将知识从合成数据传递到实域数据。我们的广泛评估表明,PatchRefiner 在 Unreal4KStereo 数据集上显著优于现有基准,以 root mean squared error (RMSE) 提高 18.1%,在 diverse 实域数据集如 CityScape、ScanNet++ 和 ETH3D 上在细节准确性和一致的 scale 估计方面显示显著改进。

关键词

引用

@article{arxiv.2406.06679,
  title  = {PatchRefiner: Leveraging Synthetic Data for Real-Domain High-Resolution Monocular Metric Depth Estimation},
  author = {Zhenyu Li and Shariq Farooq Bhat and Peter Wonka},
  journal= {arXiv preprint arXiv:2406.06679},
  year   = {2024}
}