用于未知动态环境中开放词汇移动操作的3D语义地图
机器人学
2024-06-27 v1 人工智能
计算机视觉与模式识别
摘要
开放词汇移动操作(OVMM)是自主机器人尤其在面对未知动态环境挑战时的关键能力。该任务要求机器人探索并构建周围环境的语义理解,生成实现操作目标的可行计划,适应环境变化,并理解来自人类的自然语言指令。为解决这些挑战,我们提出了一种新框架,利用预训练视觉语言模型(VLM)的零样本检测和 grounding recognition能力,结合稠密3D实体重建构建3D语义地图。此外,我们利用大语言模型(LLM)进行空间区域抽象和在线规划,融合人类指令和空间语义上下文。我们构建了10自由度的移动操作机器人平台JSR-1,并在真实世界机器人实验中展示了我们提出的框架能够有效捕获空间语义并处理来自人类的自然语言指令,以实现动态环境下的零样本OVMM任务,在105个episode中整体导航和任务成功率分别为80.95%和73.33%,相较于基线方法在SFT和SPL上分别提高了157.18%和19.53%。此外,该框架能够根据从3D语义地图中推导出的空间语义上下文,当初始计划失败时重新规划至下一个最可能的候选位置,保持平均成功率为76.67%。
引用
@article{arxiv.2406.18115,
title = {Open-vocabulary Mobile Manipulation in Unseen Dynamic Environments with 3D Semantic Maps},
author = {Dicong Qiu and Wenzong Ma and Zhenfu Pan and Hui Xiong and Junwei Liang},
journal= {arXiv preprint arXiv:2406.18115},
year = {2024}
}
备注
Open-vocabulary, Mobile Manipulation, Dynamic Environments, 3D Semantic Maps, Zero-shot, LLMs, VLMs, 18 pages, 2 figures