用于深度视觉惯性里程计融合与位姿估计的因果 Transformer
计算机视觉与模式识别
2024-09-16 v1
摘要
近年来,基于 Transformer 的架构已成为深度学习框架中序列建模的事实标准。受成功案例的启发,我们提出了一种用于深度视觉惯性里程计中位姿估计的因果视觉-惯性融合 Transformer (VIFT)。本研究旨在通过利用 Transformer 中的注意力机制来提高位姿估计精度,与近期方法中常见的基于循环神经网络 (RNN) 的方法相比,它能更好地利用历史数据。Transformer 通常需要大规模数据进行训练。为解决此问题,我们为深度 VIO 网络引入了归纳偏置。由于潜在的视觉-惯性特征向量包含了位姿估计的关键信息,我们利用 Transformer 通过时序更新潜在向量来优化位姿估计。我们的研究还通过利用 SE(3) 群元素的专用梯度进行反向传播,探讨了数据不平衡和旋转学习方法在视觉惯性里程计有监督端到端学习中的影响。所提出的方法是端到端可训练的,并且在推理时仅需单目相机和 IMU。实验结果表明,VIFT 提高了单目 VIO 网络的精度,在 KITTI 数据集上与先前方法相比取得了最先进的结果。代码将发布于 https://github.com/ybkurt/VIFT。
引用
@article{arxiv.2409.08769,
title = {Causal Transformer for Fusion and Pose Estimation in Deep Visual Inertial Odometry},
author = {Yunus Bilge Kurt and Ahmet Akman and A. Aydın Alatan},
journal= {arXiv preprint arXiv:2409.08769},
year = {2024}
}
备注
Accepted to ECCV 2024 2nd Workshop on Vision-Centric Autonomous Driving (VCAD)