中文

从预见到深思:基于潜在对齐的视觉语言模型内置策略引导

机器人学 2025-05-05 v3 机器学习

摘要

虽然生成式机器人策略在从演示中学习复杂多模态行为方面展现出巨大潜力,但部署时仍表现出多样的失败。策略引导通过使用外部验证器从不完美的生成式策略所提议的低层动作中选择,提供了一种优雅的降低失败概率方法。人们希望利用视觉语言模型(VLM)作为验证器,利用其开放式推理能力。然而,现有的VLM难以理解低层机器人动作的后果,因为这些动作的表示方式根本不同于VLM训练时所接触的文本和图像。在此基础上,我们提出FOREWARN框架,以实现VLM作为开放词汇验证器的潜力。我们的核心思想是将VLM预测动作后果(预见)与评估(深思)分离。对于预见,我们利用潜在世界模型根据多样化的低层动作方案构想未来潜在状态。对于深思,我们将VLM与这些预测的潜在状态对齐,以其本机表示——自然语言——进行推理,从而有效筛选所提议的方案。我们在多样化的机器人操控任务上验证了该框架,展示了其桥接表示鸿沟并提供稳健、通用策略引导的能力。项目网站可见演示视频:https://yilin-wu98.github.io/forewarn/。

关键词

引用

@article{arxiv.2502.01828,
  title  = {From Foresight to Forethought: VLM-In-the-Loop Policy Steering via Latent Alignment},
  author = {Yilin Wu and Ran Tian and Gokul Swamy and Andrea Bajcsy},
  journal= {arXiv preprint arXiv:2502.01828},
  year   = {2025}
}