NavCoT:通过学习解耦推理提升基于 LLM 的视觉语言导航
计算机视觉与模式识别
2025-03-25 v2 人工智能
计算与语言
机器人学
摘要
视觉语言导航(VLN)作为具身人工智能的一个关键研究问题,要求具身智能体遵循自然语言指令在复杂的 3D 环境中进行导航。最近的研究强调了大型语言模型(LLM)在 VLN 中的潜力,提高了导航推理的准确性和可解释性。然而,它们主要以离线方式使用,通常遭受 VLN 任务与 LLM 训练语料库之间存在巨大领域差距的问题。本文介绍了一种称为导航思维链(NavCoT)的新策略,其中我们执行参数高效的领域内训练,以实现自引导的导航决策,从而以具有成本效益的方式显著缓解领域差距。具体而言,在每个时间步,提示 LLM 通过以下方式预测导航思维链:1) 充当世界模型,根据指令想象下一个观测值;2) 选择与想象最匹配的候选观测值;3) 基于前几步的推理确定动作。通过构建形式化的训练标签,LLM 可以学习生成期望且合理的思维链输出,以改进动作决策。在各种训练设置和流行 VLN 基准(例如 Room-to-Room (R2R)、Room-across-Room (RxR)、Room-for-Room (R4R))上的实验结果表明,NavCoT 相较于直接动作预测变体具有显著优势。通过简单的参数高效微调,我们的 NavCoT 在 R2R 数据集上比最近的基于 GPT4 的方法高出约 7% 的相对提升。我们相信 NavCoT 将有助于解锁更多适应任务且可扩展的基于 LLM 的具身智能体,这对开发现实世界的机器人应用大有裨益。代码地址:https://github.com/expectorlin/NavCoT。
引用
@article{arxiv.2403.07376,
title = {NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning},
author = {Bingqian Lin and Yunshuang Nie and Ziming Wei and Jiaqi Chen and Shikui Ma and Jianhua Han and Hang Xu and Xiaojun Chang and Xiaodan Liang},
journal= {arXiv preprint arXiv:2403.07376},
year = {2025}
}
备注
Accepted by TPAMI 2025