中文

VLBiMan:视觉语言锚定的一次性示范实现可泛化的双臂机器人操作

机器人学 2026-05-04 v4

摘要

实现可泛化的双臂操作需要能够从最少人类输入中高效学习,同时适应真实世界不确定性与多样化本体形态的系统。现有方法面临两难:模仿策略学习需要大量示范以覆盖任务变化,而模块化方法在动态场景中往往缺乏灵活性。我们引入了VLBiMan,这是一个通过任务感知分解从单个人类示例中提取可复用技能的框架,将不变原语保留为锚点,同时通过视觉语言锚定动态适配可调组件。该适配机制利用语义解析与几何可行性约束,解决了由背景变化、物体重新定位或视觉杂乱引起的场景歧义,且无需重新训练策略。此外,该系统继承了类人混合控制能力,实现了双臂同步与异步的混合使用。大量实验在工具使用与多物体任务中验证了VLBiMan,证明:(1)与模仿基线相比,大幅减少了示范需求;(2)通过原子技能拼接实现了长时序任务的组合泛化;(3)对语义相似的新物体与外部干扰具有鲁棒性;(4)强大的跨本体形态迁移能力,表明从人类示范中学习的技能无需重新训练即可在不同机器人平台上实例化。通过将人类先验与视觉语言锚定的适配相结合,我们的工作向非结构化环境中实用且通用的双臂操作迈出了一步。

关键词

引用

@article{arxiv.2509.21723,
  title  = {VLBiMan: Vision-Language Anchored One-Shot Demonstration Enables Generalizable Bimanual Robotic Manipulation},
  author = {Huayi Zhou and Kui Jia},
  journal= {arXiv preprint arXiv:2509.21723},
  year   = {2026}
}

备注

accepted by ICLR 2026. The project link is https://hnuzhy.github.io/projects/VLBiMan/