$A^2$Nav:利用基础模型的视觉-语言能力实现动作感知的零样本机器人导航
计算机视觉与模式识别
2023-08-17 v1 机器人学
摘要
我们研究零样本视觉-语言导航(ZS-VLN)任务,这是一个实用但具有挑战性的问题,其中智能体学习遵循由语言指令描述的路径进行导航,而无需任何路径-指令标注数据。通常,指令具有复杂的语法结构,并经常包含各种动作描述(例如“proceed beyond”、“depart from”)。如何正确理解和执行这些动作需求是一个关键问题,而标注数据的缺失使其更具挑战性。请注意,受过良好教育的人类无需任何特殊训练即可轻松理解路径指令。在本文中,我们提出一种动作感知的零样本 VLN 方法(Nav),利用基础模型的视觉-语言能力。具体而言,所提方法由指令解析器和动作感知导航策略组成。指令解析器利用大语言模型(如 GPT-3)的先进推理能力,将复杂的导航指令分解为一系列动作特定的物体导航子任务。每个子任务要求智能体根据相关的动作需求定位物体并导航至特定目标位置。为完成这些子任务,从自由收集的动作特定数据集中学习动作感知导航策略,这些数据集揭示了每个动作需求的不同特征。我们使用学习到的导航策略依次执行子任务以遵循导航指令。大量实验表明,Nav 取得了有前景的 ZS-VLN 性能,甚至在 R2R-Habitat 和 RxR-Habitat 数据集上超越了监督学习方法。
引用
@article{arxiv.2308.07997,
title = {$A^2$Nav: Action-Aware Zero-Shot Robot Navigation by Exploiting Vision-and-Language Ability of Foundation Models},
author = {Peihao Chen and Xinyu Sun and Hongyan Zhi and Runhao Zeng and Thomas H. Li and Gaowen Liu and Mingkui Tan and Chuang Gan},
journal= {arXiv preprint arXiv:2308.07997},
year = {2023}
}