SpatialNav:利用空间场景图实现零样本视觉语言导航
计算机视觉与模式识别
2026-01-13 v1 人工智能
机器人学
摘要
尽管基于学习的视觉语言导航 (VLN) 智能体能够从大规模训练数据中隐式学习空间知识,但零样本 VLN 智能体缺乏这一过程,主要依赖局部观测进行导航,从而导致探索效率低下和显著的性能差距。为解决此问题,本文考虑一种零样本 VLN 设置,即在任务执行前允许智能体充分探索环境。随后构建空间场景图 (Spatial Scene Graph, SSG) 以显式捕获已探索环境中的全局空间结构和语义信息。基于 SSG,本文引入 SpatialNav—a 个零样本 VLN 智能体,集成了以主体为中心的空间地图、与指南针对齐的视觉表征以及远程物体定位策略,以实现高效导航。在离散环境和连续环境中的全面实验表明,SpatialNav 显著优于现有的零样本智能体,明显缩小了与领先学习方法的差距。这些结果突显了全局空间表征对通用导航重要性。
引用
@article{arxiv.2601.06806,
title = {SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation},
author = {Jiwen Zhang and Zejun Li and Siyuan Wang and Xiangyu Shi and Zhongyu Wei and Qi Wu},
journal= {arXiv preprint arXiv:2601.06806},
year = {2026}
}
备注
11 pages, 4 figures, 6 tables