中文

RSRNav:用于图像-目标导航的推理空间关系

计算机视觉与模式识别 2025-08-29 v2 机器人学

摘要

最近的图像-目标导航(ImageNav)方法通过单独捕获目标和眼部图像的语义特征,然后将其传递给策略网络来学习感知-动作策略。然而,仍存在挑战:(1) 语义特征常常无法提供准确的方向信息,导致不必要的动作,(2) 当训练和应用之间的视点不一致时,性能会显著下降。为解决这些挑战,我们提出了 RSRNav,一种简单而有效的方法,通过推理目标和当前观察之间的空间关系作为导航指南。具体而言,我们通过构建目标和当前观察之间的相关性来建模空间关系,然后将其传递给策略网络进行动作预测。这些相关性通过细粒度交叉相关和方向感知相关性逐步细化,以实现更精确的导航。在三个基准数据集上进行的广泛评估表明,RSRNav 在导航性能方面优于现有方法,特别是在"user-matched goal"设置下,突显了其在实际应用中的潜力。

关键词

引用

@article{arxiv.2504.17991,
  title  = {RSRNav: Reasoning Spatial Relationship for Image-Goal Navigation},
  author = {Zheng Qin and Le Wang and Yabing Wang and Sanping Zhou and Gang Hua and Wei Tang},
  journal= {arXiv preprint arXiv:2504.17991},
  year   = {2025}
}