中文

MetricGold: 利用文本到图像潜在扩散模型进行度量深度估计

计算机视觉与模式识别 2024-12-06 v2 人工智能 图形学 机器人学

摘要

从单张图像恢复度量深度仍然是计算机视觉中的一项基本挑战,需要同时具备场景理解能力和精确的缩放。尽管深度学习推动了单目深度估计的发展,但当前模型通常在陌生场景和布局中表现不佳,特别是在零样本场景以及预测尺度遍历的度量深度时。我们提出了 MetricGold,一种利用生成扩散模型丰富先验来改进度量深度估计的新方法。基于 MariGold、DDVM 和 Depth Anything V2 的最新进展,我们的方法结合了潜在扩散、对数尺度的度量深度表示以及合成数据训练。MetricGold 使用来自 HyperSIM、VirtualKitti 和 TartanAir 的照片级真实合成数据,在单张 RTX 3090 上两天内即可实现高效训练。我们的实验表明,该方法在多个不同数据集上均表现出鲁棒的泛化能力,与现有方法相比,能够产生更锐利、更高质量的度量深度估计。

关键词

引用

@article{arxiv.2411.10886,
  title  = {MetricGold: Leveraging Text-To-Image Latent Diffusion Models for Metric Depth Estimation},
  author = {Ansh Shah and K Madhava Krishna},
  journal= {arXiv preprint arXiv:2411.10886},
  year   = {2024}
}