PatchFusion:用于高分辨率单目度量深度估计的端到端分块框架
计算机视觉与模式识别
2023-12-06 v1
摘要
单图像深度估计是计算机视觉和生成建模中的一项基础任务。然而,当今的深度估计模型难以适应消费级相机和设备中日益普遍的高分辨率。现有的高分辨率策略显示出潜力,但它们通常面临从误差传播到高频细节丢失等诸多限制。我们提出了 PatchFusion,这是一种基于分块(tile-based)的新型框架,包含三个关键组件以改进当前的技术水平:(1) 一个分块融合网络,通过高层特征引导将全局一致的粗略预测与更精细但不一致的分块预测相融合;(2) 一个 Global-to-Local (G2L) 模块,为融合网络添加关键上下文,摒弃了对分块选择启发式方法的需求;(3) 一种 Consistency-Aware Training (CAT) 与 Inference (CAI) 方法,强调分块重叠一致性,从而消除了后处理的必要性。在 UnrealStereo4K、MVS-Synth 和 Middleburry 2014 上的实验表明,我们的框架能够生成具有复杂细节的高分辨率深度图。PatchFusion 独立于用于深度估计的基础模型。值得注意的是,我们建立在 SOTA ZoeDepth 之上的框架在 UnrealStereo4K 和 MVS-Synth 上的均方根误差(RMSE)分别提升了 17.3% 和 29.4%。
引用
@article{arxiv.2312.02284,
title = {PatchFusion: An End-to-End Tile-Based Framework for High-Resolution Monocular Metric Depth Estimation},
author = {Zhenyu Li and Shariq Farooq Bhat and Peter Wonka},
journal= {arXiv preprint arXiv:2312.02284},
year = {2023}
}