中文

面向动态场景的基于语义分割的几何约束单目尺度估计

计算机视觉与模式识别 2025-03-07 v1

摘要

单目视觉定位通过从单个针孔相机估计车辆的自我运动,在先进驾驶辅助系统和自动驾驶中发挥关键作用。然而,由于投影过程中缺乏深度信息,传统的单目视觉里程计在尺度估计方面面临挑战。基于物理约束或深度学习范式的先前方法在计算复杂度和动态对象管理方面存在问题。本研究扩展了我们先前的研究,提出了自我运动估计和地面点选择的创新策略。力求在计算效率与精度之间取得精细平衡,我们提出了一种利用 SegNeXt 模型进行实时应用的混合方法,涵盖自我运动估计和地面点选择。我们的方法采用动态对象掩膜以消除不稳定特征,并使用地面平面掩膜进行精确三角测量。此外,我们利用几何约束来划定道路区域以进行尺度恢复。该方法与单目 ORB-SLAM3 的结合最终实现了道路模型的准确估计,这是我们尺度恢复过程中的关键组成部分。在 KITTI 数据集上进行的严格实验系统地比较了我们的方法与现有单目视觉里程计算法和当代尺度恢复方法。结果无可否认地证实了我们方法的优越有效性,超越了最先进的视觉里程计算法。我们的源代码可在 https://github.com/bFr0zNq/MVOSegScale 获取。

关键词

引用

@article{arxiv.2503.04235,
  title  = {Geometry-Constrained Monocular Scale Estimation Using Semantic Segmentation for Dynamic Scenes},
  author = {Hui Zhang and Zhiyang Wu and Qianqian Shangguan and Kang An},
  journal= {arXiv preprint arXiv:2503.04235},
  year   = {2025}
}