中文

OpenNav:基于多模态大语言模型的开放世界导航

机器人学 2025-12-29 v1 人工智能

摘要

预训练的大型语言模型 (LLM) 已显示出强大的常识推理能力,因而在机器人导航和规划任务中具有前景。然而,尽管近期取得了进展,但在开放世界中,将语言描述与实际机器人动作建立联系——超出仅调用有限预定义运动原语的范畴——仍是一个开放性挑战。本文旨在使机器人能够解释和分解复杂的语言指令,从而合成一系列轨迹点,以完成给定开放指令和开放对象下的多样化导航任务。我们观察到,多模态大语言模型 (MLLM) 在处理自由形式语言指令时表现出强大的跨模态理解能力, demonstrate robust scene comprehension。更重要的是,利用其代码生成能力,MLLM 可与视觉语言感知模型交互,以生成构成性二维鸟瞰图值图,从而有效地将 MLLM 的语义知识与地图的空间信息相结合,以强化机器人的空间理解。为进一步验证我们的方法,我们有效地利用大规模自动驾驶数据集 (AVDs) 来验证我们提出的零样本视觉语言导航框架在户外导航任务中的有效性,表明其能够在保持对物体检测错误和语言歧义的鲁棒性的同时,执行多样化的自由形式自然语言导航指令。此外,我们在 Husky 机器人上进行了室内和户外场景的验证,展示了其实际应用中的鲁棒性。补充视频可在 https://trailab.github.io/OpenNav-website/ 查看。

关键词

引用

@article{arxiv.2507.18033,
  title  = {OpenNav: Open-World Navigation with Multimodal Large Language Models},
  author = {Mingfeng Yuan and Letian Wang and Steven L. Waslander},
  journal= {arXiv preprint arXiv:2507.18033},
  year   = {2025}
}