中文

SA4Depth:自监督单目深度估计中的一致姿态-深度尺度对齐

计算机视觉与模式识别 2026-05-28 v1

摘要

自监督单目序列深度估计依赖于深度网络与姿态网络的联合学习。尽管已有大量研究致力于改进深度网络,但关于姿态网络的探索仍有限。在此背景下,尽管深度估计仅能得到尺度不确定的结果,我们强调了姿态网络与深度网络所估计场景尺度之间对齐的重要性。我们提出了 SA4Depth 方法,以改善这种对齐并提升深度预测性能,同时保持推理时间不变。该方法利用训练期间估计的深度,对连续帧中的可学习视觉特征进行重投影,并通过减少特征对齐残差来细化姿态估计。通过本方法,独立的深度与姿态网络所估计的场景尺度得到对齐,不同序列之间的预测尺度一致性得到提升。我们所做的可微分细化可无缝集成到现有的自监督管道中,并显著提升其深度估计结果。我们在 KITTI、Cityscapes 和 NYUv2 数据集上进行了户外和室内的大量实验。此外,KITTI Odometry 结果也证明了姿态细化的有效性。我们的代码已公开于 https://github.com/Runningchauncey/SA4Depth。

关键词

引用

@article{arxiv.2605.28477,
  title  = {SA4Depth: Consistent Pose-Depth Scale Alignment for Self-Supervised Monocular Depth Estimation},
  author = {Changxuan Li and Nadine Berner and Nassir Navab and Federico Tombari and Stefano Gasperini},
  journal= {arXiv preprint arXiv:2605.28477},
  year   = {2026}
}

备注

Accepted by IEEE RA-L 2026