基于先验构建:面向数据高效真实世界机器人操作的视觉-语言引导神经符号模仿学习
机器人学
2026-04-07 v1 人工智能
摘要
使机器人从少量演示中学习长期操作任务始终是机器人学中的核心挑战。现有神经符号方法常依赖手工构建的符号抽象、语义标记的轨迹或大规模演示数据集,限制了其可扩展性和现实应用性。我们提出一种可扩展神经符号框架,从最少 1 到 30 条未标记技能演示中自主构建符号规划域和数据高效控制策略,无需手动领域工程。该方法将演示分割为技能,并利用视觉-语言模型 (VLM) 对技能进行分类,识别等价的高层次状态,从而自动构建状态转换图。该图被处理以生成 PDDL 规划域,该域的一个仿函数利用该图来隔离每个技能策略的最小、任务相关且针对目标的观察和动作空间。策略在控制参考层级上学习,而非在原始执行器信号层级,从而获得更平滑、更不嘈杂的学习目标。已知控制器可通过将单个演示投影到场景中的其他对象来实现真实数据增强,同时丰富图构建过程和模仿学习的数据集。我们主要在真实工业叉车上进行验证,并在 Kinova Gen3 机器人臂上通过两个标准基准测试展示跨平台通用性。结果表明,将控制学习、VLM 驱动的抽象和自动规划综合到统一管道中,构成了通往可扩展、数据高效、无需专家且可解释神经符号机器人技术的实用路径。
引用
@article{arxiv.2604.03759,
title = {Build on Priors: Vision--Language--Guided Neuro-Symbolic Imitation Learning for Data-Efficient Real-World Robot Manipulation},
author = {Pierrick Lorang and Johannes Huemer and Timothy Duggan and Kai Goebel and Patrik Zips and Matthias Scheutz},
journal= {arXiv preprint arXiv:2604.03759},
year = {2026}
}