中文

SPIdepth:面向自监督单目深度估计的强化位姿信息

计算机视觉与模式识别 2024-09-04 v3 图像与视频处理

摘要

自监督单目深度估计因其在自动驾驶和机器人领域的应用而备受关注。尽管最近的方法在利用自查询层(SQL)等技术从运动中推断深度方面取得了进展,但它们往往忽略了强化位姿信息的潜力。在本文中,我们引入了 SPIdepth,这是一种优先增强位姿网络以改进深度估计的新方法。建立在 SQL 的基础之上,SPIdepth 强调了位姿信息在捕捉细粒度场景结构中的重要性。通过增强位姿网络的能力,SPIdepth 在场景理解和深度估计方面取得了显著进展。在 KITTI、Cityscapes 和 Make3D 等基准数据集上的实验结果展示了 SPIdepth 的 SOTA 性能,以显著优势超越了以往的方法。具体而言,SPIdepth 在自监督 KITTI 基准上名列前茅。此外,SPIdepth 在 KITTI 上取得了最低的 AbsRel (0.029)、SqRel (0.069) 和 RMSE (1.394),确立了新的 SOTA 结果。在 Cityscapes 上,即使不使用运动掩码,SPIdepth 相较于 SQLdepth 在 AbsRel 上提升了 21.7%,在 SqRel 上提升了 36.8%,在 RMSE 上提升了 16.5%。在 Make3D 上,SPIdepth 在零样本设置下优于所有其他模型。值得注意的是,SPIdepth 仅使用单张图像进行推理就取得了这些结果,甚至超越了利用视频序列进行推理的方法,从而证明了其在实际应用中的有效性和效率。我们的方法代表了自监督单目深度估计的重大飞跃,突显了强化位姿信息对于推进实际应用中场景理解的重要性。代码和预训练模型已在 https://github.com/Lavreniuk/SPIdepth 公开发布。

关键词

引用

@article{arxiv.2404.12501,
  title  = {SPIdepth: Strengthened Pose Information for Self-supervised Monocular Depth Estimation},
  author = {Mykola Lavreniuk},
  journal= {arXiv preprint arXiv:2404.12501},
  year   = {2024}
}