中文

VOCAL:基于对比学习的视觉里程计

计算机视觉与模式识别 2026-01-26 v2

摘要

视觉里程计(VO)的诸多突破性进展彻底改变了机器人领域的格局,使其能够实现超精确的相机状态估计,这对于现代自主系统至关重要。尽管如此,许多基于学习的VO技术仍依赖刚性几何假设,这些假设在可解释性方面往往不足,且缺乏在完全数据驱动框架内的坚实理论基础。为克服这些限制,我们引入了 VOCAL(Visual Odometry via ContrAstive Learning),一个重新构想VO作为标签排序挑战的新框架。通过将贝叶斯推断与表示学习框架集成,VOCAL 将视觉特征组织以镜像相机状态。排序机制迫使相似的相机状态在潜在空间中收敛到一致且在空间上连贯的表示。这种战略性对齐不仅增强了所学特征的可解释性,还确保了与多模态数据源的兼容性。对 KITI 数据集进行的广泛评估突显了 VOCAL 的增强可解释性和灵活性,推动了VO向更通用和可解释的空间智能发展。

关键词

引用

@article{arxiv.2507.00243,
  title  = {VOCAL: Visual Odometry via ContrAstive Learning},
  author = {Chi-Yao Huang and Zeel Bhatt and Yezhou Yang},
  journal= {arXiv preprint arXiv:2507.00243},
  year   = {2026}
}

备注

Accepted to WACV 2026