中文

IGL-Nav:面向图像目标导航的增量式 3D 高斯定位

计算机视觉与模式识别 2025-08-04 v1 机器人学

摘要

以图像作为目标的视觉导航是一项基本且具有挑战性的问题。常用方法要么依赖基于端到端的强化学习,要么基于拓扑图或 BEV 地图的模块化策略,这些方法无法充分建模已探索 3D 环境与目标图像之间的几何关系。为高效且准确地在 3D 空间中定位目标图像,我们基于可渲染的 3D 高斯 (3DGS) 表示构建了导航系统。然而,由于 3DGS 优化的计算密集性以及 6-DoF 相机姿态搜索空间的庞大,直接在智能体探索过程中利用 3DGS 进行图像定位在效率上不可行。为此,我们提出 IGL-Nav,即一种用于高效且 3D-aware 图像目标导航的增量式 3D 高斯定位框架。具体而言,我们通过基于单目预测的增量更新场景表示以处理新到达的图像。然后我们利用几何信息进行离散空间匹配,以实现粗略定位,这等价于高效的 3D 卷积。当智能体靠近目标时,我们最终通过可微分渲染进行精细目标姿态求解。所提出的 IGL-Nav 在多样化的实验配置下均显著优于现有最先进方法。它还能处理更具挑战性的自由视角图像目标设置,并可部署在实际机器人平台上,使用手机随意捕获目标图像。项目页面:https://gwxuan.github.io/IGL-Nav/。

关键词

引用

@article{arxiv.2508.00823,
  title  = {IGL-Nav: Incremental 3D Gaussian Localization for Image-goal Navigation},
  author = {Wenxuan Guo and Xiuwei Xu and Hang Yin and Ziwei Wang and Jianjiang Feng and Jie Zhou and Jiwen Lu},
  journal= {arXiv preprint arXiv:2508.00823},
  year   = {2025}
}

备注

Accepted to ICCV 2025. Project page: https://gwxuan.github.io/IGL-Nav/