中文

ReasonNavi:基于人类启发的全局地图推理实现零样本具身导航

机器人学 2026-02-19 v1 计算机视觉与模式识别

摘要

具身智能体常因依赖主要是局部的环视观察而难以高效导航,这限制了全局预见并导致低效的探索。相比之下,人类会先进行全局规划,再进行局部行动。我们提出了 ReasonNavi,一个受人类启发的框架,通过将多模态大型语言模型(MLLM)与确定性规划器耦合来实现 reason-then-act 范式。ReasonNavi 将自上而下的地图转换为离散的推理空间,通过房间分割和候选目标节点抽样。随后,对 MLLM 进行多阶段查询,以识别最符合指令(对象、图像或文本目标)的候选节点,有效利用模型的语义推理能力,同时规避其在连续坐标预测方面的弱点。选定的路标通过确定性动作规划器在在线构建的占用网格上转化为可执行轨迹,同时利用预训练的对象检测器和分割器确保目标处的稳健识别。由此形成一个无需 MLLM 微调、规避基于强化学习策略脆弱性、并自然随基础模型改进而扩展的统一零样本导航框架。在三个导航任务上,ReasonNavi 持续优于需要大量训练或重型场景建模的先前方法,提供了一个可扩展、可解释且全局导向的具身导航解决方案。项目页面:https://reasonnavi.github.io/

关键词

引用

@article{arxiv.2602.15864,
  title  = {ReasonNavi: Human-Inspired Global Map Reasoning for Zero-Shot Embodied Navigation},
  author = {Yuzhuo Ao and Anbang Wang and Yu-Wing Tai and Chi-Keung Tang},
  journal= {arXiv preprint arXiv:2602.15864},
  year   = {2026}
}

备注

18 pages, 6 figures, Project page: https://reasonnavi.github.io/