窃取 Stable Diffusion 先验以实现鲁棒的单目深度估计
计算机视觉与模式识别
2024-03-11 v1
摘要
单目深度估计是计算机视觉中的一项关键任务。尽管现有方法在标准条件下已展现出令人印象深刻的结果,但由于缺乏多样化的训练数据,它们在低光照或雨天等场景中的可靠表现往往面临挑战。本文提出了一种名为“窃取 Stable Diffusion 先验”(Stealing Stable Diffusion, SSD)的新方法,用于鲁棒的单目深度估计。该方法利用 Stable Diffusion 生成模拟挑战性条件的合成图像,从而解决了上述局限性。此外,引入了一种自训练机制,以增强模型在此类挑战性环境中的深度估计能力。为了进一步提升对 Stable Diffusion 先验的利用,我们将 DINOv2 编码器集成到深度模型架构中,使模型能够利用丰富的语义先验并改善其场景理解能力。此外,我们引入了一种教师损失(teacher loss),以指导学生模型独立获取有意义的知识,从而减少其对教师模型的依赖。该方法在 nuScenes 和 Oxford RobotCar 两个具有挑战性的公共数据集上进行了评估,结果证明了该方法的有效性。源代码和权重可在以下地址获取:https://github.com/hitcslj/SSD。
引用
@article{arxiv.2403.05056,
title = {Stealing Stable Diffusion Prior for Robust Monocular Depth Estimation},
author = {Yifan Mao and Jian Liu and Xianming Liu},
journal= {arXiv preprint arXiv:2403.05056},
year = {2024}
}