中文

用于行星空地机器人团队中领域可泛化跨视图定位的视觉基础模型

计算机视觉与模式识别 2026-04-30 v1 机器人学

摘要

在行星机器人技术中,精确的定位能够实现支持未来任务规模和范围扩大的高级自主性。Ingenuity 直升机和多个行星轨道器的成功为未来使用空地机器人团队的任务奠定了基础。在本文中,我们考虑漫游车使用机器学习,以有限的视场单目地面 RGB 图像作为输入,在局部航空地图中定位自身。机器学习方法的一个关键考虑因素是,带有适合训练的真实位置标签的真实空间数据非常稀缺。在这项工作中,我们提出了一种使用跨视图定位双编码器深度神经网络在航空地图中定位漫游车的新方法。我们利用视觉基础模型的语义分割和大量合成数据来弥合与真实图像之间的领域差距。我们还贡献了一个新的跨视图数据集,包含在行星模拟设施中捕获的真实漫游车轨迹和相应的真实定位数据,以及大量类似合成图像对的数据集。使用粒子滤波器与跨视图网络进行状态估计,允许基于地面图像序列在简单和复杂轨迹上进行精确的位置估计。

关键词

引用

@article{arxiv.2601.09107,
  title  = {Vision Foundation Models for Domain Generalisable Cross-View Localisation in Planetary Ground-Aerial Robotic Teams},
  author = {Lachlan Holden and Feras Dayoub and Alberto Candela and David Harvey and Tat-Jun Chin},
  journal= {arXiv preprint arXiv:2601.09107},
  year   = {2026}
}

备注

7 pages, 10 figures. Presented at the International Conference on Space Robotics (iSpaRo) 2025 in Sendai, Japan. Dataset available: https://doi.org/10.5281/zenodo.17364038