中文

基于亮度引导的混合 Transformer 视觉里程计模型 BRIGHT-VO

计算机视觉与模式识别 2025-05-01 v4

摘要

视觉里程计(VO)通过基于视觉输入估计相机的位置和姿态,在自动驾驶、机器人导航等相关任务中发挥着关键作用。数据驱动的 VO 方法尤其是利用深度学习技术提取图像特征并估计相机姿态的方法取得了显著进展。然而,这些方法在低光条件下常常难以处理,因为特征可见性降低且关键点匹配困难。为此,我们引入 BrightVO,这是一个基于 Transformer 架构的新颖 VO 模型,不仅执行前端视觉特征提取,还在后端集成惯性测量单元(IMU)数据,包含一种多模态细化模块。该模块使用姿态图优化不断细化姿态估计,以减少误差并提高准确性和鲁棒性。此外,我们创建了一个包含多种光照条件的合成低光数据集 KiC4R,以促进 VO 框架在具有挑战性环境中的训练和评估。实验结果表明,BrightVO 在 KiC4R 数据集和 KITTI 基准测试中均实现了 SOTA 性能。具体而言,在正常户外环境中,其姿态估计准确率平均提高了 20%,在低光条件下提高了 259%,超越了现有方法。为便于广泛使用和进一步发展,本研究工作已完全开源于 https://github.com/Anastasiawd/BrightVO。

关键词

引用

@article{arxiv.2501.08659,
  title  = {BRIGHT-VO: Brightness-Guided Hybrid Transformer for Visual Odometry with Multi-modality Refinement Module},
  author = {Dongzhihan Wang and Yang Yang and Liang Xu},
  journal= {arXiv preprint arXiv:2501.08659},
  year   = {2025}
}