中文

基于视觉语言模型的端到端导航:将空间推理转化为问答

机器人学 2024-11-11 v1 计算与语言 计算机视觉与模式识别

摘要

我们提出了VLMnav,一个将视觉语言模型转化为端到端导航策略的具身框架。与先前工作不同,我们不依赖感知、规划和控制之间的分离;相反,我们使用视觉语言模型直接一步选择动作。令人惊讶的是,我们发现视觉语言模型可以零样本地用作端到端策略,即无需任何微调或接触导航数据。这使得我们的方法具有开放性和通用性,可适用于任何下游导航任务。我们进行了广泛的研究,以评估我们的方法相对于基线提示方法的性能。此外,我们进行了设计分析,以理解最有影响力的设计决策。视觉示例和项目代码可在https://jirl-upenn.github.io/VLMnav/ 获取。

关键词

引用

@article{arxiv.2411.05755,
  title  = {End-to-End Navigation with Vision Language Models: Transforming Spatial Reasoning into Question-Answering},
  author = {Dylan Goetting and Himanshu Gaurav Singh and Antonio Loquercio},
  journal= {arXiv preprint arXiv:2411.05755},
  year   = {2024}
}