中文

基于视觉语言模型的预测控制用于操作规划与轨迹生成

机器人学 2025-04-08 v1

摘要

模型预测控制(MPC)是一种广泛采用的控制范式,利用预测模型估计未来系统状态并针对性地优化控制输入。然而,尽管MPC在规划和控制方面表现出色,但缺乏环境感知能力,导致在复杂且非结构化场景中出现失败。为此,我们提出了视觉语言模型预测控制(VLMPC),一种集成视觉语言模型(VLM)感知能力与MPC的机器人操作规划框架。VLMPC利用条件动作采样模块,以目标图像或语言指令为输入,借助VLM生成候选动作序列。这些候选方案被输入到视频预测模型中,用于基于动作模拟未来帧。此外,我们提出了改进版Traj-VLMPC,取代视频预测为运动轨迹生成,以降低计算复杂度,同时保持精度。Traj-VLMPC在候选动作条件下估计运动动力学,为长期任务和实时应用提供更高效的方案。两种方法均使用基于VLM的层次化代价函数,以捕捉当前观测与任务输入在像素级和知识级一致性,选取最优动作序列。我们在公开基准测试中证明,两种方法均优于现有最先进方法,并在 various 实际机器人操作任务中取得优异性能。代码已公开于 https://github.com/PPjmchen/VLMPC。

关键词

引用

@article{arxiv.2504.05225,
  title  = {Vision-Language Model Predictive Control for Manipulation Planning and Trajectory Generation},
  author = {Jiaming Chen and Wentao Zhao and Ziyu Meng and Donghui Mao and Ran Song and Wei Pan and Wei Zhang},
  journal= {arXiv preprint arXiv:2504.05225},
  year   = {2025}
}