中文

将基于扩散的图像生成器改造用于单目深度估计

计算机视觉与模式识别 2024-04-04 v2

摘要

单目深度估计是一项基础的计算机视觉任务。从单张图像中恢复 3D 深度在几何上是病态的,并且需要场景理解,因此深度学习的兴起带来了突破并不令人意外。单目深度估计器的令人瞩目的进展反映了模型容量的增长,从相对适度的 CNN 到大型 Transformer 架构。尽管如此,当面对内容和布局不熟悉的图像时,单目深度估计器往往表现不佳,因为它们对视觉世界的认知受限于训练期间所见的数据,并且在向新领域进行零样本泛化时面临挑战。这促使我们探索近期生成扩散模型中捕获的丰富先验是否能够实现更好、更具泛化能力的深度估计。我们引入了 Marigold,这是一种用于仿射不变单目深度估计的方法,它源自 Stable Diffusion 并保留了其丰富的先验知识。该估计器可以在单块 GPU 上仅使用合成训练数据在几天内完成微调。它在广泛的数据集上提供了 SOTA 性能,在特定情况下性能提升超过 20%。项目页面:https://marigoldmonodepth.github.io。

关键词

引用

@article{arxiv.2312.02145,
  title  = {Repurposing Diffusion-Based Image Generators for Monocular Depth Estimation},
  author = {Bingxin Ke and Anton Obukhov and Shengyu Huang and Nando Metzger and Rodrigo Caye Daudt and Konrad Schindler},
  journal= {arXiv preprint arXiv:2312.02145},
  year   = {2024}
}

备注

CVPR 2024 camera ready