中文

单目深度与视觉里程计的自监督预训练与微调

计算机视觉与模式识别 2024-06-18 v1

摘要

对于单目深度与视觉里程计的联合估计任务,我们提出采用两步学习自监督基于变换器的模型。我们的第一步是采用跨视图完成目标(CroCo)进行通用预训练,以学习 3D 几何信息,随后在无标注视频上进行自监督微调。我们展示,所提方法可通过标准组件(如视觉变换器、密集预测变换器和适配器)实现无需任何额外技巧的领先性能。我们通过在六个基准数据集上进行评估(包括静态和动态、室内和室外、合成和真实图像),证明了所提方法的有效性。对于所有数据集,本方法均优于领先方法,尤其在深度预测任务中表现更佳。

关键词

引用

@article{arxiv.2406.11019,
  title  = {Self-supervised Pretraining and Finetuning for Monocular Depth and Visual Odometry},
  author = {Boris Chidlovskii and Leonid Antsfeld},
  journal= {arXiv preprint arXiv:2406.11019},
  year   = {2024}
}

备注

8 pages, to appear in ICRA'24