中文

稀疏激光雷达引导的单目几何基础:面向长程驾驶深度的实证研究

计算机视觉与模式识别 2026-05-27 v1

摘要

稀疏激光雷达引导的深度基座模型(PromptDA、Prior Depth Anything、DMD3C)在室内场景或 KITTI 标准80米评估范围内表现突出。然而仍存在两个局限:(i) 在长程驾驶场景(50-150米)中缺乏系统性距离分层评估;(ii) 现有方法基于视差的基座,依赖预插值稠密先验,将稀疏激光雷达输入注入到点图基座(如 MoGe-2、NeurIPS 2025)方面尚未得到探索。我们提出 SLIM(Sparse-LiDAR Injected Monocular geometry),首次将 MoGe-2 适配以接受真正稀疏的激光雷达输入。SLIM 集成部分卷积稀疏编码器与多尺度融合颈部,在五个尺度处将激光雷达特征注入点图解码器。我们采用密度无关的训练方式(随机注入比例为 [0.005, 0.30]),使单个模型可服务于不同输入密度。在 Virtual KITTI 和 CARLA 上,SLIM 将 MoGe-2 基准的绝对相对误差在100-150米处降低约39-51%。在六种注入比率的消融实验中发现,部分卷积注入在 Virtual KITTI 的所有六种设置下均能改善 AbsRel 和 RMSE;在 CARLA 上,AbsRel 在五个设置中改善(一个接近0.015的设置仅差0.0013),而 RMSE 在不同编码器间相当,部分卷积在三个设置中提升(最高提升0.31单位),在其余三个设置中最多只差0.11单位。

关键词

引用

@article{arxiv.2605.26456,
  title  = {Sparse-LiDAR Prompting of Monocular Geometry Foundations: An Empirical Study Toward Long-Range Driving Depth},
  author = {Kai Zheng and Qiang Feng and Xingjian Liu and Wenquan Tan and Yuan Li},
  journal= {arXiv preprint arXiv:2605.26456},
  year   = {2026}
}

备注

6 pages, 3 figures, 2 tables