中文

基于Transformer的单目视觉里程计模型:一种视频理解方法

计算机视觉与模式识别 2025-01-22 v3 人工智能 机器人学

摘要

给定单目相机图像估计相机位姿是移动机器人与自动驾驶车辆中的传统任务。该问题称为单目视觉里程计,常依赖于针对特定场景需要大量工程工作的几何方法。深度学习方法已表明在经过恰当训练及大量可用数据下具有泛化能力。基于Transformer的架构已在自然语言处理与计算机视觉任务(如图像与视频理解)中主导了最先进水平。在本工作中,我们将单目视觉里程计作为视频理解任务来处理,以估计相机位姿的6自由度。我们的贡献在于提出基于时空自注意力机制的TSformer-VO模型,从视频片段中提取特征并以端到端方式估计运动。我们的方法在KITTI视觉里程计数据集上相较于基于几何与基于深度学习的方法取得了有竞争力的SOTA性能,大幅优于视觉里程计界广泛接受的DeepVO实现。代码公开于https://github.com/aofrancani/TSformer-VO。

关键词

引用

@article{arxiv.2305.06121,
  title  = {Transformer-Based Model for Monocular Visual Odometry: A Video Understanding Approach},
  author = {André O. Françani and Marcos R. O. A. Maximo},
  journal= {arXiv preprint arXiv:2305.06121},
  year   = {2025}
}

备注

This work has been accepted for publication in IEEE Access