中文

SpatialNav:利用空间场景图实现零样本视觉语言导航

计算机视觉与模式识别 2026-01-13 v1 人工智能 机器人学

摘要

尽管基于学习的视觉语言导航 (VLN) 智能体能够从大规模训练数据中隐式学习空间知识,但零样本 VLN 智能体缺乏这一过程,主要依赖局部观测进行导航,从而导致探索效率低下和显著的性能差距。为解决此问题,本文考虑一种零样本 VLN 设置,即在任务执行前允许智能体充分探索环境。随后构建空间场景图 (Spatial Scene Graph, SSG) 以显式捕获已探索环境中的全局空间结构和语义信息。基于 SSG,本文引入 SpatialNav—a 个零样本 VLN 智能体,集成了以主体为中心的空间地图、与指南针对齐的视觉表征以及远程物体定位策略,以实现高效导航。在离散环境和连续环境中的全面实验表明,SpatialNav 显著优于现有的零样本智能体,明显缩小了与领先学习方法的差距。这些结果突显了全局空间表征对通用导航重要性。

关键词

引用

@article{arxiv.2601.06806,
  title  = {SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation},
  author = {Jiwen Zhang and Zejun Li and Siyuan Wang and Xiangyu Shi and Zhongyu Wei and Qi Wu},
  journal= {arXiv preprint arXiv:2601.06806},
  year   = {2026}
}

备注

11 pages, 4 figures, 6 tables