中文

DVLO4D:基于稀疏时空融合的深视觉-LiDAR 激光定位

计算机视觉与模式识别 2025-09-09 v1

摘要

视觉-LiDAR 激光定位是自主系统定位的关键组件,但实现高精度和强鲁棒性仍具有挑战。传统方法常常在传感器对齐方面吃力,未能充分利用时序信息,且需要 extensive manual tuning 来处理多样化的传感器配置。为此,我们提出 DVLO4D,一种利用稀疏时空融合来提升精度和鲁棒性的视觉-LiDAR 激光定位框架。我们的方法提出了三个关键创新点:(1) 稀疏查询融合(Sparse Query Fusion),利用稀疏 LiDAR 查询实现有效的多模态数据融合;(2) 时序交互与更新模块(Temporal Interaction and Update module),将时序预测位置与当前帧数据集成,为姿态估计提供更好的初始化值,并增强模型对累积误差的鲁棒性;(3) 时序剪辑训练策略(Temporal Clip Training strategy)结合整体平均损失机制(Collective Average Loss mechanism),跨多个帧聚合损失,实现全局优化,减少长序列中的尺度漂移。在 KITTI 和 Argoverse 激光定位数据集上的大量实验表明,我们提出的 DVLO4D 在姿态精度和鲁棒性方面实现了最佳性能。此外,我们的方法计算效率高,推理时间为 82 毫秒,具备实时部署的潜力。

关键词

引用

@article{arxiv.2509.06023,
  title  = {DVLO4D: Deep Visual-Lidar Odometry with Sparse Spatial-temporal Fusion},
  author = {Mengmeng Liu and Michael Ying Yang and Jiuming Liu and Yunpeng Zhang and Jiangtao Li and Sander Oude Elberink and George Vosselman and Hao Cheng},
  journal= {arXiv preprint arXiv:2509.06023},
  year   = {2025}
}

备注

Accepted by ICRA 2025