NavGPT:基于大语言模型的视觉与语言导航显式推理
计算机视觉与模式识别
2023-10-20 v3 人工智能
计算与语言
机器人学
摘要
借助前所未有的数据规模训练,诸如 ChatGPT 与 GPT-4 之类的大语言模型(LLM)展现出因模型规模扩大而涌现的显著推理能力。这一趋势凸显了以无限语言数据训练 LLM 以推进通用具身智能体发展的潜力。在本文中,我们引入 NavGPT,一种纯粹的基于 LLM 的指令跟随导航智能体,通过对视觉与语言导航(VLN)执行零样本顺序动作预测,揭示 GPT 模型在复杂具身场景中的推理能力。在每一步,NavGPT 以视觉观测的文本描述、导航历史与未来可探索方向作为输入,推理智能体的当前状态,并做出接近目标的决策。通过综合实验,我们证明 NavGPT 能显式执行导航的高层规划,包括将指令分解为子目标、整合与导航任务求解相关的常识知识、从观测场景中识别地标、跟踪导航进度,以及通过计划调整适应异常。此外,我们展示 LLM 能够沿路径根据观测与动作生成高质量导航指令,并根据智能体导航历史绘制准确的俯视度量轨迹。尽管将 NavGPT 用于零样本 R2R 任务的性能仍不及训练模型,我们建议将多模态输入适配于 LLM 以用作视觉导航智能体,并应用 LLM 的显式推理裨益基于学习的模型。
引用
@article{arxiv.2305.16986,
title = {NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large Language Models},
author = {Gengze Zhou and Yicong Hong and Qi Wu},
journal= {arXiv preprint arXiv:2305.16986},
year = {2023}
}