从文字到轮子:基于视觉的无人地面车辆理解人类语言指令
机器人学
2024-10-15 v1
摘要
本文介绍了一种创新的基础模型应用,使配备 RGB-D 相机的无人地面车辆(UGV)能够基于人类语言指令导航至指定目的地。不同于学习方法,本方法无需先验训练,而是利用现有的基础模型,从而实现对新环境的泛化。 upon 接收到人类语言指令后,这些指令被转换为一种“认知路线描述”,即以人类语言表达的详细导航路线。车辆随后将此描述分解为地标和导航机动。车辆还确定elevation成本,通过基于开放数据集训练的地形分割模型 GANav 来识别不同区域的可导航水平。将elevation和可导航水平综合考虑的语义elevation成本被估计并提供给 Model Predictive Path Integral (MPPI) 规划器,该规划器负责局部路径规划。同时,车辆利用包括 YOLO-World 和 EfficientViT-SAM 在内的基础模型搜索目标地标。最终,车辆执行导航命令到达最终地标。我们的实验表明,这一应用成功地在新环境(如不熟悉的地形或城市环境)中,按照人类语言指令指引 UGV 到达目的地。
关键词
引用
@article{arxiv.2410.10577,
title = {Words to Wheels: Vision-Based Autonomous Driving Understanding Human Language Instructions Using Foundation Models},
author = {Chanhoe Ryu and Hyunki Seong and Daegyu Lee and Seongwoo Moon and Sungjae Min and D. Hyunchul Shim},
journal= {arXiv preprint arXiv:2410.10577},
year = {2024}
}
备注
7 pages, 7 figures