MetricGold: 利用文本到图像潜在扩散模型进行度量深度估计
计算机视觉与模式识别
2024-12-06 v2 人工智能
图形学
机器人学
摘要
从单张图像恢复度量深度仍然是计算机视觉中的一项基本挑战,需要同时具备场景理解能力和精确的缩放。尽管深度学习推动了单目深度估计的发展,但当前模型通常在陌生场景和布局中表现不佳,特别是在零样本场景以及预测尺度遍历的度量深度时。我们提出了 MetricGold,一种利用生成扩散模型丰富先验来改进度量深度估计的新方法。基于 MariGold、DDVM 和 Depth Anything V2 的最新进展,我们的方法结合了潜在扩散、对数尺度的度量深度表示以及合成数据训练。MetricGold 使用来自 HyperSIM、VirtualKitti 和 TartanAir 的照片级真实合成数据,在单张 RTX 3090 上两天内即可实现高效训练。我们的实验表明,该方法在多个不同数据集上均表现出鲁棒的泛化能力,与现有方法相比,能够产生更锐利、更高质量的度量深度估计。
引用
@article{arxiv.2411.10886,
title = {MetricGold: Leveraging Text-To-Image Latent Diffusion Models for Metric Depth Estimation},
author = {Ansh Shah and K Madhava Krishna},
journal= {arXiv preprint arXiv:2411.10886},
year = {2024}
}