中文

PrimeDepth:利用稳定扩散预图像实现高效单目深度估计

计算机视觉与模式识别 2024-09-17 v1

摘要

本文致力于解决零样本单目深度估计任务。该领域的一个最新进展是利用文本到图像基础模型(如Stable Diffusion)的思想。基础模型提供了丰富且通用的图像表示,因此,只需少量训练数据即可将其重构为深度估计模型,该模型能预测高度细节化的深度图并具有良好的泛化能力。然而,迄今为止,这一思想的实现方法在测试时由于底层的迭代去噪过程而效率极低。在这项工作中,我们提出了该思想的一种不同实现方式,并展示了PrimeDepth方法,该方法在测试时效率极高,同时保持甚至增强了基于扩散方法的优点。我们的核心思想是,通过运行单步去噪,从Stable Diffusion中提取一个丰富但冻结的图像表示。我们将此表示称为预像,然后将其馈送到一个具有架构归纳偏置的精炼器网络中,再进入下游任务。我们通过实验验证,PrimeDepth比领先的基于扩散的方法Marigold快两个数量级,同时在挑战性场景下更鲁棒,且定量上略优。因此,我们缩小了与当前领先的数据驱动方法Depth Anything的差距,后者在定量上仍然更优,但预测的深度图细节较少,且需要多20倍的标注数据。由于我们方法的互补性,即使是对PrimeDepth和Depth Anything的预测进行简单平均,也能改进这两种方法,并在零样本单目深度估计中设立了新的最先进水平。未来,数据驱动方法也可能从集成我们的预像中受益。

关键词

引用

@article{arxiv.2409.09144,
  title  = {PrimeDepth: Efficient Monocular Depth Estimation with a Stable Diffusion Preimage},
  author = {Denis Zavadski and Damjan Kalšan and Carsten Rother},
  journal= {arXiv preprint arXiv:2409.09144},
  year   = {2024}
}