移动前讨论:基于多专家讨论的视觉语言导航
机器人学
2023-09-21 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
视觉语言导航(VLN)是一项具身任务,需要涵盖理解、感知与规划在内的广泛技能。对于这一多面挑战,以往的VLN方法完全依赖单一模型自身的思考在一轮内做出预测。然而,现有模型,即便是最先进的大语言模型GPT4,仍难以通过单轮自我思考处理多项任务。本工作中,受专家咨询会议启发,我们引入一种新颖的零样本VLN框架。在该框架中,具备不同能力的大模型被用作领域专家。我们提出的导航智能体,即DiscussNav,可在每一步移动前主动与这些专家讨论以收集关键信息。这些讨论涵盖指令理解、环境感知与完成度估计等关键导航子任务。通过综合实验,我们证明与领域专家的讨论能够通过感知指令相关信息、纠正无意错误以及筛选不一致的移动决策来有效促进导航。在代表性VLN任务R2R上的性能表明,我们的方法在所有指标上大幅超越领先的零样本VLN模型。此外,真实机器人实验显示了我们的方法相对于单轮自我思考的明显优势。
引用
@article{arxiv.2309.11382,
title = {Discuss Before Moving: Visual Language Navigation via Multi-expert Discussions},
author = {Yuxing Long and Xiaoqi Li and Wenzhe Cai and Hao Dong},
journal= {arXiv preprint arXiv:2309.11382},
year = {2023}
}
备注
Submitted to ICRA 2024