中文

FSR-VLN:基于层次化多模态场景图的视觉语言导航中的快速与缓慢推理

机器人学 2025-11-26 v3

摘要

视觉语言导航(VLN)是机器人系统中的基础挑战,具有广泛的实际应用前景。尽管近期研究取得进展,但现有方法在长程空间推理方面受限,常表现出低成功率和高推理延迟,尤其在长距离导航任务中。为此,我们提出FSR-VLN,一种结合层次化多模态场景图(HMSG)和快速到缓慢导航推理(FSR)的视觉语言导航系统。HMSG提供支持从粗糙房间级定位到细粒度目标视图和目标识别的多模态地图表示。基于HMSG,FSR首先进行快速匹配,高效筛选候选房间、视图和目标,然后采用VLM驱动的细化进行最终目标选择。我们在四个由人oid机器人收集的综合室内数据集上评估了FSR-VLN,包含87条指令,涵盖多样目标类别。FSR-VLN在所有数据集上实现了最先进(SOTA)性能,采用检索成功率(RSR)衡量,同时将响应时间缩短了82%,相较于基于VLM的方法,通过仅在快速直觉失败时激活缓慢推理实现。此外,我们将FSR-VLN集成到Unitree-G1人oid机器人上的语音交互、规划和控制模块中,实现自然语言交互和实时导航。

关键词

引用

@article{arxiv.2509.13733,
  title  = {FSR-VLN: Fast and Slow Reasoning for Vision-Language Navigation with Hierarchical Multi-modal Scene Graph},
  author = {Xiaolin Zhou and Tingyang Xiao and Liu Liu and Yucheng Wang and Maiyue Chen and Xinrui Meng and Xinjie Wang and Wei Feng and Wei Sui and Zhizhong Su},
  journal= {arXiv preprint arXiv:2509.13733},
  year   = {2025}
}

备注

Demo video are available at https://horizonrobotics.github.io/robot_lab/fsr-vln/