中文

Mobility VLA:基于长上下文VLM与拓扑图的多模态指令导航

机器人学 2024-07-15 v2 人工智能

摘要

导航研究中的一个难以实现的目标是构建一个能够理解包括自然语言和图像在内的多模态指令,并执行有用导航的智能体。为此,我们研究了一类广泛有用的导航任务,称为带演示导览的多模态指令导航(MINT),其中环境先验通过先前录制的演示视频提供。视觉语言模型(VLM)的最新进展展示了感知和推理多模态输入的能力,为实现这一目标提供了有希望的路径。然而,VLM通常被训练用于预测文本输出,如何最好地将其用于导航仍是一个开放的研究问题。为了解决MINT,我们提出了Mobility VLA,一种分层视觉-语言-动作(VLA)导航策略,它结合了长上下文VLM的环境理解和常识推理能力,以及基于拓扑图的鲁棒低级导航策略。高级策略由一个长上下文VLM组成,该VLM将演示导览视频和多模态用户指令作为输入,以在导览视频中找到目标帧。接下来,低级策略使用目标帧和离线构建的拓扑图在每个时间步生成机器人动作。我们在一个836平方米的真实世界环境中评估了Mobility VLA,并表明Mobility VLA在以前未解决的多模态指令(例如“我应该把这个塑料箱还到哪里?”)上具有较高的端到端成功率。展示Mobility VLA的视频可在此处找到:https://youtu.be/-Tof__Q8_5s

关键词

引用

@article{arxiv.2407.07775,
  title  = {Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs},
  author = {Hao-Tien Lewis Chiang and Zhuo Xu and Zipeng Fu and Mithun George Jacob and Tingnan Zhang and Tsang-Wei Edward Lee and Wenhao Yu and Connor Schenck and David Rendleman and Dhruv Shah and Fei Xia and Jasmine Hsu and Jonathan Hoech and Pete Florence and Sean Kirmani and Sumeet Singh and Vikas Sindhwani and Carolina Parada and Chelsea Finn and Peng Xu and Sergey Levine and Jie Tan},
  journal= {arXiv preprint arXiv:2407.07775},
  year   = {2024}
}