中文

基于关键帧的前馈视觉里程计

计算机视觉与模式识别 2026-01-23 v1 机器人学

摘要

视觉基础模型的出现彻底改变了视觉里程计和 SLAM,使得在单个前馈网络内进行位姿估计和稠密重建成为可能。然而,与利用关键帧方法来提高效率和准确性的传统流程不同,当前基于基础模型的方法,如 VGGT-Long,通常不加区分地处理原始图像序列。这导致了计算冗余,并因帧间视差小(提供的上下文立体信息有限)而导致性能下降。将传统的几何启发式方法整合到这些方法中并非易事,因为它们的性能依赖于高维潜在表示,而非显式的几何度量。为了弥合这一差距,我们提出了一种新颖的基于关键帧的前馈视觉里程计。我们的方法不依赖于手工制定的规则,而是采用强化学习,以数据驱动的方式推导出自适应的关键帧策略,使选择与底层基础模型的内在特性保持一致。我们在 TartanAir 数据集上训练了我们的智能体,并在多个真实世界数据集上进行了广泛的评估。实验结果表明,所提出的方法相比最先进的前馈视觉里程计方法,取得了一致且显著的改进。

关键词

引用

@article{arxiv.2601.16020,
  title  = {Keyframe-Based Feed-Forward Visual Odometry},
  author = {Weichen Dai and Wenhan Su and Da Kong and Yuhang Ming and Wanzeng Kong},
  journal= {arXiv preprint arXiv:2601.16020},
  year   = {2026}
}