中文

VLMPC:基于视觉语言模型的预测控制用于机器人操作

机器人学 2024-07-16 v1

摘要

虽然模型预测控制(Model Predictive Control, MPC)能够有效预测系统的未来状态,因此广泛应用于机器人操作任务中,但它缺乏环境感知能力,在某些复杂场景中会导致失败。为此,我们引入了视觉语言模型预测控制(Vision-Language Model Predictive Control, VLMPC),这是一种集成了视觉语言模型(VLM)强大感知能力的机器人操作框架。具体而言,我们提出了一个条件动作采样模块,该模块以目标图像或语言指令作为输入,利用 VLM 对一组备选动作序列进行采样。随后,我们设计了一个轻量级的动作条件视频预测模型,用于生成以备选动作序列为条件的一组未来帧。VLMPC 通过层次化代价函数,构建了当前观察与目标图像之间的像素级和知识级一致性,辅助 VLM 选择最优动作序列。我们展示了 VLMPC 在公共基准测试中的优于最先进方法的性能。更重要的是,我们的方法在各种真实世界的机器人操作任务中表现出色。代码已公开于~\url{https://github.com/PPjmchen/VLMPC}。

关键词

引用

@article{arxiv.2407.09829,
  title  = {VLMPC: Vision-Language Model Predictive Control for Robotic Manipulation},
  author = {Wentao Zhao and Jiaming Chen and Ziyu Meng and Donghui Mao and Ran Song and Wei Zhang},
  journal= {arXiv preprint arXiv:2407.09829},
  year   = {2024}
}

备注

Accepted by RSS2024