中文

基于反射的无先验知识开放词汇导航:利用全向相机与多视觉语言模型

机器人学 2024-08-22 v1 人工智能 系统与控制 系统与控制

摘要

已开发了各种机器人导航方法,但它们主要基于同时定位与建图(SLAM)、强化学习等,这些方法需要先验地图构建或学习。在本研究中,我们考虑了一种不需要任何地图构建或学习的最简方法,并执行无需任何先验知识的机器人开放词汇导航。我们将全向相机和预训练的视觉语言模型应用于机器人。全向相机提供了周围环境的均匀视图,从而消除了对包括轨迹生成在内的复杂探索行为的需求。通过将多个预训练的视觉语言模型应用于该全向图像并结合反射行为,我们表明导航变得简单且不需要任何先验设置。基于与移动机器人Fetch的实验,讨论了本方法的有趣特性和局限性。

关键词

引用

@article{arxiv.2408.11380,
  title  = {Reflex-Based Open-Vocabulary Navigation without Prior Knowledge Using Omnidirectional Camera and Multiple Vision-Language Models},
  author = {Kento Kawaharazuka and Yoshiki Obinata and Naoaki Kanazawa and Naoto Tsukamoto and Kei Okada and Masayuki Inaba},
  journal= {arXiv preprint arXiv:2408.11380},
  year   = {2024}
}

备注

Accepted at Advanced Robotics, website - https://haraduka.github.io/omnidirectional-vlm/