通过在线视觉语言映射在真实世界中进行视觉与语言导航
机器人学
2023-10-18 v1 计算机视觉与模式识别
系统与控制
系统与控制
摘要
在未知环境中导航对移动机器人至关重要。赋予其遵循自然语言指令的能力将进一步提升在未知情形下的导航效率。然而,当前最优(SOTA)视觉与语言导航(VLN)方法主要在仿真中评估,忽视了复杂且嘈杂的真实世界。由于视觉域差距以及对未知环境缺乏先验知识,直接将仿真中训练的 SOTA 导航策略迁移到真实世界具有挑战性。本工作中,我们提出一种新颖的导航框架以解决真实世界中的 VLN 任务。利用强大的基础模型,所提框架包含四个关键组件:(1)基于 LLM 的指令解析器,将语言指令转换为预定义宏动作描述序列;(2)在线视觉语言映射器,构建实时视觉语言地图以维持对未知环境的空间与语义理解;(3)基于语言索引的定位器,将每个宏动作描述锚定到地图上的路点位置;(4)基于 DD-PPO 的局部控制器,预测动作。我们在未知实验室环境中使用 Interbotix LoCoBot WX250 评估所提流程。无需任何微调,我们的流程在真实世界中显著优于 SOTA VLN 基线。
引用
@article{arxiv.2310.10822,
title = {Vision and Language Navigation in the Real World via Online Visual Language Mapping},
author = {Chengguang Xu and Hieu T. Nguyen and Christopher Amato and Lawson L. S. Wong},
journal= {arXiv preprint arXiv:2310.10822},
year = {2023}
}