中文

利用图像语义编码的稳定扩散模型进行单目深度估计

计算机视觉与模式识别 2025-02-05 v1 机器学习

摘要

单目深度估计涉及从单张RGB图像预测深度,在自动驾驶、机器人导航、三维重建等应用中起着关键作用。基于学习的方法的最新进展显著提高了深度估计性能。生成模型,特别是稳定扩散(Stable Diffusion),通过在大规模多样化数据集上的训练,在恢复精细细节和重建缺失区域方面显示出巨大潜力。然而,像CLIP这样依赖文本嵌入的模型,在需要丰富上下文信息的复杂室外环境中面临局限性。这些局限性降低了它们在此类挑战性场景中的有效性。在此,我们提出一种新颖的基于图像的语义嵌入,直接从视觉特征中提取上下文信息,显著改善了复杂环境中的深度预测。在KITTI和Waymo数据集上的评估表明,我们的方法在解决CLIP嵌入处理室外场景的缺点的同时,实现了与最先进模型相当的性能。通过直接利用视觉语义,我们的方法在深度估计任务中展示了增强的鲁棒性和适应性,展现了其应用于其他视觉感知任务的潜力。

关键词

引用

@article{arxiv.2502.01666,
  title  = {Leveraging Stable Diffusion for Monocular Depth Estimation via Image Semantic Encoding},
  author = {Jingming Xia and Guanqun Cao and Guang Ma and Yiben Luo and Qinzhao Li and John Oyekan},
  journal= {arXiv preprint arXiv:2502.01666},
  year   = {2025}
}