中文

利用预训练深度基础模型提升全向立体匹配

计算机视觉与模式识别 2025-10-29 v3 人工智能 机器学习 机器人学

摘要

全向深度感知对于需要在完整 360{\deg} 视场下进行场景理解的移动机器人应用至关重要。基于相机的方案通过立体深度估计生成密集、高分辨率深度图,是一种经济高效的选择,无需依赖昂贵的主动传感。然而,受限于真实世界数据的稀缺,现有全向立体匹配方法在多样化环境、深度范围与光照条件下仅能达到有限的深度精度。我们提出 DFI-OmniStereo,一种新颖的全向立体匹配方法,在基于迭代优化的立体匹配架构中利用大规模预训练基础模型进行相对单目深度估计。我们引入专门的两阶段训练策略,在尺度不变微调之前,将相对单目深度特征用于全向立体匹配。DFI-OmniStereo 在真实世界 Helvipad 数据集上取得了当前最优结果,与此前的最佳全向立体方法相比,视差 MAE 降低了约 16%。

关键词

引用

@article{arxiv.2503.23502,
  title  = {Boosting Omnidirectional Stereo Matching with a Pre-trained Depth Foundation Model},
  author = {Jannik Endres and Oliver Hahn and Charles Corbière and Simone Schaub-Meyer and Stefan Roth and Alexandre Alahi},
  journal= {arXiv preprint arXiv:2503.23502},
  year   = {2025}
}

备注

Accepted at IROS 2025. Project page: https://vita-epfl.github.io/DFI-OmniStereo-website/