中文

Select2Plan: 通过VQA和记忆检索实现无需训练的ICL规划

机器人学 2024-11-07 v1 人工智能

摘要

本研究探讨了现成的视觉语言模型(VLMs)在自主导航高层机器人规划中的潜力。事实上,尽管大多数现有的基于学习的路径规划方法需要大量的任务特定训练/微调,我们证明了在大多数实际情况下可以避免这种训练。为此,我们引入了Select2Plan(S2P),一个新颖的无需训练的高层机器人规划框架,完全消除了微调或专门训练的需求。通过利用结构化的视觉问答(VQA)和上下文学习(ICL),我们的方法大幅减少了数据收集的需求,仅需要训练模型通常使用的一小部分任务特定数据,甚至仅依赖在线数据。我们的方法促进了以灵活且成本高效的方式使用通用训练的VLM,不需要额外的感知设备,仅需一个简单的单目相机。我们在两种不同场景中展示了其适应性:传统的首视角(FPV)和基础设施驱动的第三人称视角(TPV)导航,展示了我们方法的灵活性和简洁性。我们的技术在TPV场景中将基线VLM的导航能力显著提升了约50%,在FPV场景中与训练模型相当,仅需20个演示。

关键词

引用

@article{arxiv.2411.04006,
  title  = {Select2Plan: Training-Free ICL-Based Planning through VQA and Memory Retrieval},
  author = {Davide Buoso and Luke Robinson and Giuseppe Averta and Philip Torr and Tim Franzmeyer and Daniele De Martini},
  journal= {arXiv preprint arXiv:2411.04006},
  year   = {2024}
}