通过合成神经符号监督从视觉语言模型学习结构化机器人策略
机器人学
2026-05-18 v2
摘要
视觉语言模型(VLM)最近在将多模态观测映射到机器人行为方面展现出强大能力。然而,大多数当前方法依赖不透明且难以分析的端到端视觉运动策略,限制了其在真实世界机器人应用中的使用。相比之下,经典机器人系统通常依赖提供可解释性、模块化和响应式执行的结构化策略表示。本工作研究了基础模型如何被专门化以生成基于多模态感知的结构化机器人策略,桥接高维学习与符号控制。我们提出了一种神经符号方法,其中 VLM 从视觉观测、自然语言指令和结构化系统规范中合成可执行的行为树策略。为实现可扩展的监督而无需人工标注,我们引入了一个自动化流程,生成由基础模型产生的指令-策略示例配对的领域随机化场景合成多模态数据集。通过在受限符号语法下解耦结构化任务分解与硬件特定的运动控制,我们证明一个 12B 参数模型可以仅通过仿真监督学习可执行行为树合成所需的结构化空间符号映射。在两个异构机器人操纵器上的真实物理实验证实,这些结构约束策略实现了到真实环境的零样本迁移。结果强调,机器人规划中的数据瓶颈可以通过程序化合成高保真神经符号训练数据来绕过。
引用
@article{arxiv.2604.02812,
title = {Learning Structured Robot Policies from Vision-Language Models via Synthetic Neuro-Symbolic Supervision},
author = {Alessandro Adami and Tommaso Tubaldo and Marco Todescato and Ruggero Carli and Pietro Falco},
journal= {arXiv preprint arXiv:2604.02812},
year = {2026}
}