中文

FSUNav:一种用于快速、安全和通用零样本目标导向导航的脑干-小脑架构

机器人学 2026-04-06 v1

摘要

当前视觉语言导航方法在异构机器人兼容性、实时性能和导航安全性方面存在显著瓶颈。此外,这些方法难以支持开放词汇语义泛化和多模态任务输入。为此,本文提出FSUNav:一种用于快速、安全和通用零样本目标导向导航的脑干-小脑架构,创新性地将视觉语言模型(Vision-Language Models, VLMs)与该架构集成。小脑模块是一个高频端到端模块,基于深度强化学习开发通用局部规划器,实现对异构平台(如人形、四足、轮式机器人)的统一导航,提高导航效率并显著降低碰撞风险。脑干模块构建三层推理模型,利用VLMs构建端到端检测与验证机制,实现无需预定义ID的零样本开放词汇目标导航,提高仿真和真实环境中的任务成功率。此外,该框架支持多模态输入(如文本、目标描述和图像),进一步提升泛化性、实时性、安全性和鲁棒性。在MP3D、HM3D和OVON基准测试中,FSUNav在目标、实例图像和任务导航中实现了最佳性能,显著优于现有方法。真实世界部署在多样化机器人平台上进一步验证了其鲁棒性和实际适用性。

关键词

引用

@article{arxiv.2604.03139,
  title  = {FSUNav: A Cerebrum-Cerebellum Architecture for Fast, Safe, and Universal Zero-Shot Goal-Oriented Navigation},
  author = {Mingao Tan and Yiyang Li and Shanze Wang and Xinming Zhang and Wei Zhang},
  journal= {arXiv preprint arXiv:2604.03139},
  year   = {2026}
}