中文

基于层次特征引导扩散的无监督单目深度估计

计算机视觉与模式识别 2024-06-17 v1

摘要

无监督单目深度估计因其无需 ground truth 的能力而受到广泛关注。在现实场景中,图像可能因天气条件和相机固有局限性而呈现模糊或噪声。因此,开发鲁棒的深度估计模型至关重要。利于生成网络的训练策略,生成式方法往往表现出更好的鲁棒性。基于此,我们采用众所周知收敛的扩散模型进行无监督单目深度估计。此外,我们提出了一个层次特征引导去噪模块。该模型通过充分利用图像特征来指导去噪过程,显著丰富了模型学习和解释深度分布的能力。进一步,我们探索了重投影中的隐式深度,并设计了一个隐式深度一致性损失。该损失函数用于提高模型性能并确保视频序列中深度的尺度一致性。我们在 KITTI、Make3D 和我们自收集的 SIMIT 数据集上进行实验。结果表明,我们的做法在生成式方法中脱颖而出,同时展示了显著的鲁棒性。

关键词

引用

@article{arxiv.2406.09781,
  title  = {GPT-4o: Visual perception performance of multimodal large language models in piglet activity understanding},
  author = {Yiqi Wu and Xiaodan Hu and Ziming Fu and Siling Zhou and Jiangong Li},
  journal= {arXiv preprint arXiv:2406.09781},
  year   = {2024}
}