DINO-VO:基于视觉基础模型的基于特征的视觉里程计
计算机视觉与模式识别
2025-07-18 v1 人工智能
机器人学
摘要
基于学习的单目视觉里程计 (VO) 在机器人领域面临鲁棒性、泛化和效率挑战。近期出现的视觉基础模型,如 DINOv2,在 various vision tasks 中显著提升了鲁棒性和泛化能力,但在 VO 中的集成仍有限,主要由于特征粒度粗糙。本文提出 DINO-VO,一个基于 DINOv2 视觉基础模型实现稀疏特征匹配的基于特征的 VO 系统。为解决集成挑战,我们针对 DINOv2 的粗糙特征设计了一款突出关键点检测器。此外,我们将 DINOv2 的鲁棒语义特征与细粒度几何特征相结合,形成更具可定位性的表征。最后,一个基于转换器的匹配器和可微分的姿态估计层使我们能够通过学习优质匹配实现精确的相机运动估计。与类似 SuperPoint 之类的检测器-描述符网络相比,DINO-VO 在挑战性环境下的鲁棒性更强。我们还表明,所提特征描述符在独立使用 DINOv2 粗糙特征时具有卓越的准确性和泛化能力。DINO-VO 在 TartanAir 和 KITTI 数据集上超越了以前的帧到帧 VO 方法,在 EuRoC 数据集上表现出竞争力,同时在单 GPU 上以 72 FPS 的速度运行,内存使用不足 1GB。此外,它在户外驾驶场景中与视觉 SLAM 系统的竞争表现,彰显了其泛化能力。
引用
@article{arxiv.2507.13145,
title = {DINO-VO: A Feature-based Visual Odometry Leveraging a Visual Foundation Model},
author = {Maulana Bisyir Azhari and David Hyunchul Shim},
journal= {arXiv preprint arXiv:2507.13145},
year = {2025}
}
备注
8 pages, 6 figures. Accepted for publication in IEEE Robotics and Automation Letters (RA-L), July 2025