BehAV:利用 VLM 实现户外场景机器人导航的行为规则引导自主性
机器人学
2024-10-04 v2
摘要
我们提出了 BehAV,这是一种在户外场景中由人类指令引导并利用视觉语言模型(VLMs)进行自主机器人导航的新方法。我们的方法使用大语言模型(LLM)解释人类指令,并将其分为导航指南和行为指南。导航指南由方向指令(例如“一直向前走直到”)和相关地标(例如“有蓝色窗户的建筑物”)组成,而行为指南包括规范性行为(例如“保持在”)及其对应对象(例如“人行道”)。我们利用 VLM 的零样本场景理解能力,从 RGB 图像中估计地标位置以进行机器人导航。此外,我们引入了一种新的场景表示,利用 VLM 将行为规则转化为行为代价图。该代价图对场景中行为对象的存在进行编码,并根据其规范性行为分配代价。行为代价图与基于 LiDAR 的占据地图集成以进行导航。为了在遵循指令行为的同时在户外场景中进行导航,我们提出了一种基于无约束模型预测控制(MPC)的规划器,该规划器优先考虑到达地标和遵循行为指南。我们在四足机器人上评估了 BehAV 在各种真实场景中的性能,与 SOTA 方法相比,以 Frechet 距离衡量,其与人类遥操作动作的对齐度提高了 22.49%,导航成功率提高了 40%。
引用
@article{arxiv.2409.16484,
title = {BehAV: Behavioral Rule Guided Autonomy Using VLMs for Robot Navigation in Outdoor Scenes},
author = {Kasun Weerakoon and Mohamed Elnoor and Gershom Seneviratne and Vignesh Rajagopal and Senthil Hariharan Arul and Jing Liang and Mohamed Khalid M Jaffar and Dinesh Manocha},
journal= {arXiv preprint arXiv:2409.16484},
year = {2024}
}