中文

ECoDepth:用于单目深度估计的扩散模型有效条件化

计算机视觉与模式识别 2024-04-18 v4 人工智能 机器学习

摘要

在缺乏视差线索的情况下,基于学习的单图像深度估计(SIDE)模型严重依赖图像中的阴影和上下文线索。虽然这种简单性具有吸引力,但有必要在难以采集的大型且多样化的数据集上训练此类模型。已有研究表明,使用来自预训练基础模型(如 CLIP)的嵌入可以改善若干应用中的零样本迁移。受此启发,我们在本文中探索使用由预训练 ViT 模型生成的全局图像先验,以提供更详细的上下文信息。我们论证,在大型数据集上预训练的 ViT 模型的嵌入向量比通常生成伪图像描述后基于 CLIP 的文本嵌入路径能够为 SIDE 捕获更多相关信息。基于这一想法,我们提出了一种以 ViT 嵌入为条件的使用扩散主干的新 SIDE 模型。我们提出的设计在 NYUv2 数据集上为 SIDE 确立了新的 SOTA,实现了 0.059 的 Abs Rel 误差(提升 14%),而当前 SOTA(VPD)为 0.069。在 KITTI 数据集上,实现了 0.139 的 Sq Rel 误差(提升 2%),而当前 SOTA(GEDepth)为 0.142。对于在 NYUv2 上训练的模型的零样本迁移,我们报告了在(Sun-RGBD, iBims1, DIODE, HyperSim)数据集上相对于 NeWCRFs 的平均相对提升为(20%, 23%, 81%, 25%),而 ZoeDepth 为(16%, 18%, 45%, 9%)。项目页面可在 https://ecodepth-iitd.github.io 获取

关键词

引用

@article{arxiv.2403.18807,
  title  = {ECoDepth: Effective Conditioning of Diffusion Models for Monocular Depth Estimation},
  author = {Suraj Patni and Aradhye Agarwal and Chetan Arora},
  journal= {arXiv preprint arXiv:2403.18807},
  year   = {2024}
}

备注

IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2024