基于视觉语言模型的手绘图导航机器人
机器人学
2025-04-30 v2 计算机视觉与模式识别
摘要
手绘图可以用于在人类和机器人之间自然且高效地传递导航指令。然而,这些图常常包含误差,如比例失真和缺失地标,这给机器人导航带来了挑战。本文引入了一种 novel Hand-drawn Map Navigation(HAM-Nav)架构,利用预训练的视觉语言模型(VLM)实现机器人在多样化环境、手绘风格和机器人本体形式下进行导航,即使存在图纸误差也能有效工作。HAM-Nav集成了独特的Selective Visual Association Prompting方法,用于基于拓扑图的位置估计和导航规划,以及Predictive Navigation Plan Parser用于推断缺失地标。我们在光栅化模拟环境中进行了大量实验,使用 wheeled 和 legged 机器人,证明了HAM-Nav在导航成功率和按路径长度加权的成功率方面的有效性。此外,实地用户研究突显了手绘图在机器人导航中的实用价值,以及相较于非手绘图方法的导航成功结果。
引用
@article{arxiv.2502.00114,
title = {Mobile Robot Navigation Using Hand-Drawn Maps: A Vision Language Model Approach},
author = {Aaron Hao Tan and Angus Fung and Haitong Wang and Goldie Nejat},
journal= {arXiv preprint arXiv:2502.00114},
year = {2025}
}
备注
8 pages, 8 figures