中文

VLS:通过视觉语言模型驾驭预训练机器人策略

机器人学 2026-02-05 v1 计算机视觉与模式识别

摘要

为何预训练的扩散或流匹配策略在执行相同任务时靠近障碍物、站在偏移支撑面上或处于轻度杂乱环境时会失败?这种失败很少反映运动技能缺失;相反,它们暴露了在训练-测试分布迁移下的模仿学习局限——即动作生成严密耦合于训练特定的空间配置和任务规格。在这种情况下,重新训练或微调以解决这些问题成本高昂且概念上不符合预期,因为所需行为已存在但无法在测试时进行选择性适应。我们提出视觉语言驾驶(Vision-Language Steering, VLS),这是一种用于推理时适应的训练-free 框架,以便适应冻结的生成式机器人策略。VLS 将适应性视为推理时控制问题,依据超出分布的观察-语言输入,对预训练扩散或流匹配策略的采样过程进行引导,而无需修改策略参数。通过利用视觉语言模型合成可微分的轨迹奖励函数,VLS 引导去噪过程导向满足测试时空间和任务要求的动作轨迹。在仿真和真实世界评估中,VLS 在 CALVIN 上实现了 31% 的提升,在 LIBERO-PRO 上实现了 13% 的提升。真实世界部署在 Franka 机器人上进一步表明,在测试时的空间和语义偏移下,VLS 能够实现稳健的推理时适应。项目页面:https://vision-language-steering.github.io/webpage/

关键词

引用

@article{arxiv.2602.03973,
  title  = {VLS: Steering Pretrained Robot Policies via Vision-Language Models},
  author = {Shuo Liu and Ishneet Sukhvinder Singh and Yiqing Xu and Jiafei Duan and Ranjay Krishna},
  journal= {arXiv preprint arXiv:2602.03973},
  year   = {2026}
}

备注

11 Pages, Project page: https://vision-language-steering.github.io/webpage/