中文

ZeroVO:基于最小假设的视觉里程计

计算机视觉与模式识别 2025-06-10 v1

摘要

我们引入了 ZeroVO,一种新颖的视觉里程计 (VO) 算法,能够在不同的相机和环境之间实现零样本泛化,克服了现有方法中依赖预定义或静态相机校准设置的局限性。我们的方法包含三项主要创新。首先,我们设计了一种免校准、几何感知的网络结构,能够处理估计深度和相机参数中的噪声。其次,我们引入了基于语言的先验,注入语义信息以增强鲁棒的特征提取和对未见领域的泛化能力。第三,我们开发了一种灵活的半监督训练范式,利用无标签数据迭代地适应新场景,进一步提升了模型在不同真实世界场景中的泛化能力。我们分析了复杂的自动驾驶场景,在 KITTI、nuScenes 和 Argoverse 2 三个标准基准以及一个新引入的、源自 Grand Theft Auto (GTA) 的高保真合成数据集上,表现出比先前方法超过 30% 的提升。由于不需要微调或相机校准,我们的工作拓宽了 VO 的适用性,为大规模的真实世界部署提供了一种通用解决方案。

关键词

引用

@article{arxiv.2506.08005,
  title  = {ZeroVO: Visual Odometry with Minimal Assumptions},
  author = {Lei Lai and Zekai Yin and Eshed Ohn-Bar},
  journal= {arXiv preprint arXiv:2506.08005},
  year   = {2025}
}