中文

Jasmine:利用扩散先验进行自监督深度估计

计算机视觉与模式识别 2025-10-21 v3 人工智能

摘要

本文提出 Jasmine,即首个基于 Stable Diffusion (SD) 的自监督框架用于单目深度估计,有效利用 SD 的视觉先验来增强无监督预测的锐度和泛化性。以往的 SD 方法均为监督式,因为将扩散模型适用于稠密预测需要高精度监督。相反,自监督重投影面临固有挑战(如遮挡、无纹理区域、照明波动),且预测结果常出现模糊和伪影严重削弱 SD 的潜在先验。为解决此问题,我们构建了一种新颖的混合图像重建代理任务。无需额外监督,它保留了 SD 模型的细节先验,通过重建图像本身防止深度估计退化。此外,为解决 SD 的尺度-平移不变估计与自监督尺度不变深度估计之间的内在错位,我们构建了 Scale-Shift GRU。它不仅弥合了分布差距,还隔离了 SD 输出的细粒度纹理,抵抗重投影损失的干扰。广泛实验表明,Jasmine 在 KITTI 数据集上实现最佳性能,并在多个数据集上表现出优异的零样本泛化。

关键词

引用

@article{arxiv.2503.15905,
  title  = {Jasmine: Harnessing Diffusion Prior for Self-supervised Depth Estimation},
  author = {Jiyuan Wang and Chunyu Lin and Cheng Guan and Lang Nie and Jing He and Haodong Li and Kang Liao and Yao Zhao},
  journal= {arXiv preprint arXiv:2503.15905},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025. 23 pages, with the appendix