中文

SFCo-Nav:通过慢速LLM与快速属性图对齐协作实现的高效零样图视觉语言导航

机器人学 2026-03-03 v1

摘要

近年来,大型视觉语言模型(VLMs)和大型语言模型(LLMs)的进展使零样图视觉语言导航(VLN)方法得以实现,即智能体仅通过自感知和推理即可遵循自然语言指令。然而,现有零样图方法通常构建简单的观察图,对其进行逐步VLV-LLM推理,导致高延迟和计算成本,限制了其实际部署。为此,我们提出SFCo-Nav,一个受到慢-快认知协作原理启发的高效零样图VLN框架。SFCo-Nav集成了三个关键模块:1)基于慢速LLM的规划器,生成与想象对象图相连的子目标链; 2)用于实时对象图构建和子目标执行的快速反应导航器; 3)轻量级的异步慢-快桥接器,对齐高级结构化、属性化的想象图与感知图,以估计导航置信度,当必要时仅触发慢速LLM规划器。就我们所知,SFCo-Nav是首个支持基于内部置信度异步触发LLM的慢-快协作零样图VLN系统。在公开的R2R和REVERIE基准上评估后,SFCo-Nav在成功率上与先前的最新零样图VLN方法持平或更好,同时将每条轨迹的总token消耗降低超过50%,运行速度快于3.5倍。最后,我们在机械腿机器人上进行演示,展示了其在室内环境中的效率和实用性。

关键词

引用

@article{arxiv.2603.01477,
  title  = {SFCo-Nav: Efficient Zero-Shot Visual Language Navigation via Collaboration of Slow LLM and Fast Attributed Graph Alignment},
  author = {Chaoran Xiong and Litao Wei and Xinhao Hu and Kehui Ma and Ziyi Xia and Zixin Jiang and Zhen Sun and Ling Pei},
  journal= {arXiv preprint arXiv:2603.01477},
  year   = {2026}
}

备注

Accepted by 2026 IEEE International Conference on Robotics and Automation (ICRA)