中文

NavGPT-2:解放视觉语言模型的导航推理能力

计算机视觉与模式识别 2024-09-23 v2 人工智能 计算与语言 机器人学

摘要

抓住大语言模型(LLM)在指令跟随机器人导航方面取得的显著进展,当前涌现出一种利用LLM进行导航指令遵循的趋势,这凸显了LLM在泛化导航推理和多样语言理解方面的潜力。然而,在将LLM集成到视觉语言导航(VLN)任务中时,与以往下游专家模型相比,智能体性能之间存在显著差异。此外,语言在代理交互中解释和促进沟通的固有能力在这些集成中往往被低估。本文旨在弥合VLN专用模型与基于LLM的导航范式之间的鸿沟,同时保持LLM在生成语言化导航推理中的解释力。通过在冻结的LLM中对视觉内容进行对齐,我们纳入了视觉观察理解能力,同时以有效的动作预测和导航推理方式将LLM与导航策略网络集成。我们展示了所提出方法的数据效率,并消除了基于语言模型的智能体与最先进VLN专家模型之间的差距。

关键词

引用

@article{arxiv.2407.12366,
  title  = {NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models},
  author = {Gengze Zhou and Yicong Hong and Zun Wang and Xin Eric Wang and Qi Wu},
  journal= {arXiv preprint arXiv:2407.12366},
  year   = {2024}
}

备注

Accepted to ECCV 2024