中文

一种引导 MLLMs 实现视觉-语言导航的单一智能体:通过显式世界表示

机器人学 2026-02-18 v1

摘要

可导航的智能体需要理解高层语义指令和精确的空间感知。以多模态大语言模型(Multimodal Large Language Models, MLLMs)为中心构建导航智能体显示出具有强大泛化能力的潜力。然而,当前紧密耦合的设计显著限制了系统性能。本文提出一种解耦设计,将低层空间状态估计与高层语义规划分离。不同于依赖预定义过于简化文本地图的先前方法,我们引入交互式度量世界表示,保持丰富且一致的信息,允许MLLMs与之交互并进行推理以做出决策。进一步引入反事实推理以进一步激发MLLMs的能力,而度量世界表示确保所产生动作的物理有效性。我们在仿真和真实世界环境中进行全面实验。该方法在R2R-CE和RxR-CE基准上分别实现了48.8%成功率(Success Rate, SR)和42.2%,创下零样态SOTA。此外,为了验证度量表示的通用性,我们在多种 embodiment 上进行零样态仿真到真实的迁移,包括 wheeled TurtleBot 4 和自制无人机。这些真实部署验证了我们的解耦框架作为具身视觉-语言导航的稳健、领域无关的接口。

关键词

引用

@article{arxiv.2602.15400,
  title  = {One Agent to Guide Them All: Empowering MLLMs for Vision-and-Language Navigation via Explicit World Representation},
  author = {Zerui Li and Hongpei Zheng and Fangguo Zhao and Aidan Chan and Jian Zhou and Sihao Lin and Shijie Li and Qi Wu},
  journal= {arXiv preprint arXiv:2602.15400},
  year   = {2026}
}