基于扩散生成器的Feed-forward深度估计:FiffDepth
计算机视觉与模式识别
2025-03-17 v2
摘要
单目深度估计(MDE)是3D视觉中的基础问题,具有3D场景重建、自动导航和AI内容创建等众多应用。然而,由于受限的真实世界标注数据以及合成数据集与真实数据之间的分布差距,鲁棒且可泛化的MDE仍然具有挑战。现有方法常在真实世界测试数据上表现低效、准确率下降且缺乏细节。为此,我们提出一种高效MDE方法,命名为FiffDepth。FiffDepth的关键特征在于利用扩散先验,将基于扩散的图像生成器转换为用于详细深度估计的Feed-forward架构。FiffDepth保留关键生成特征,同时整合了DINOv2等模型的强大泛化能力。通过基准评估,我们展示FiffDepth在准确性、稳定性和细粒度细节方面实现了对state-of-the-art MDE方法的显著提升。论文源码可在此处访问:https://yunpeng1998.github.io/FiffDepth/
引用
@article{arxiv.2412.00671,
title = {FiffDepth: Feed-forward Transformation of Diffusion-Based Generators for Detailed Depth Estimation},
author = {Yunpeng Bai and Qixing Huang},
journal= {arXiv preprint arXiv:2412.00671},
year = {2025}
}
备注
8 pages, 7 figures