中文

基于视场条件扩散模型的零样本度量深度估计

计算机视觉与模式识别 2023-12-21 v1

摘要

尽管单目深度估计方法在标准基准上取得了显著进展,零样本度量深度估计仍未解决。挑战包括室内和室外场景的联合建模,这两类场景通常表现出显著不同的 RGB 和深度分布,以及由未知相机内参导致的深度尺度模糊。近期工作提出了专门的多头架构来联合建模室内和室外场景。相比之下,我们提倡一种通用的、任务无关的扩散模型,并进行了若干改进,例如采用对数尺度深度参数化以实现室内和室外场景的联合建模,以视场(FOV)为条件来处理尺度模糊,并在训练期间合成增强 FOV 以泛化到训练数据集中有限的相机内参之外。此外,通过采用比通常更多样化的训练混合以及高效的扩散参数化,我们的方法 DMD(Diffusion for Metric Depth)在零样本室内数据集上相对误差(REL)降低了 25%,在零样本室外数据集上降低了 33%,超越了当前 SOTA,且仅使用少量去噪步骤。概述请见 https://diffusion-vision.github.io/dmd

关键词

引用

@article{arxiv.2312.13252,
  title  = {Zero-Shot Metric Depth with a Field-of-View Conditioned Diffusion Model},
  author = {Saurabh Saxena and Junhwa Hur and Charles Herrmann and Deqing Sun and David J. Fleet},
  journal= {arXiv preprint arXiv:2312.13252},
  year   = {2023}
}