中文

基于 LVL-M 驱动的通用机器人导航:感知、推理与行动

机器人学 2025-10-20 v2 人工智能 计算机视觉与模式识别

摘要

开发用于未知环境的通用导航策略是机器人学中的核心挑战之一。大多数现有系统依赖于任务特定的神经网络和固定的信息流程,限制了其通用性。大型视觉语言模型(LVLM)提供了一种具有前景的替代方案,通过嵌入人类类知识进行推理和规划,但以往的 LVLM-机器人集成主要依赖于预映射空间、硬编码的表征和刚性控制逻辑。我们引入了 Agentic Robotic Navigation Architecture (ARNA),一个通用框架,为基于 LVLM 的智能体配备由现代机器人堆栈提供的感知、推理和导航工具库。在运行时,智能体自主定义并执行特定于任务的工作流程,不断查询模块、对多模态输入进行推理,并选择导航动作。这种智能体化表述使我们能够在尚未映射的环境中实现稳健的导航与推理,为机器人堆栈设计提供了新的视角。在 Habitat Lab 中的 HM-EQA 基准测试中,ARNA 在 EQA-specific 方法中超越了最先进的水平。RxR 和自定义任务的定性结果进一步表明其能够在广泛的导航挑战中实现通用性。

关键词

引用

@article{arxiv.2506.17462,
  title  = {General-Purpose Robotic Navigation via LVLM-Orchestrated Perception, Reasoning, and Acting},
  author = {Bernard Lange and Anil Yildiz and Mansur Arief and Shehryar Khattak and Mykel Kochenderfer and Georgios Georgakis},
  journal= {arXiv preprint arXiv:2506.17462},
  year   = {2025}
}