SViP:面向双手操作的基于对象中心运动原语的序列 visuomotor 策略
机器人学
2025-06-24 v1
摘要
模仿学习(Imitation Learning, IL),尤其是当利用高维视觉输入进行策略训练时,在复杂的双手操作任务中表现出直观且有效的优势。然而,视觉运动策略的泛化能力仍有限,尤其是在数据集较小的情况下。视觉运动策略中的累积误差显著阻碍了其完成长期orizon 任务的能力。为此,我们提出了 SViP 框架,将视觉运动策略无缝集成到任务与运动规划(Task and Motion Planning, TAMP)中。SViP 通过语义场景图监控器将人类演示划分为双手和单手操作。利用关键场景图中的连续决策变量来训练切换条件生成器。该生成器产生参数化的脚本式原语,即使在遇到非分布观测时也能确保可靠性能。仅需 20 组真实世界演示,SViP 即可实现视觉运动策略在非分布初始条件下的泛化,无需对象姿态估计器。对于以往未遇到的任务,SViP 能自动发现有效解,以实现目标,利用 TAMP 形式化中的约束建模。在真实世界实验中,SViP 超越了最新的生成式 IL 方法,表明其在更复杂任务上具有更广的适用性。项目网站:https://sites.google.com/view/svip-bimanual
引用
@article{arxiv.2506.18825,
title = {SViP: Sequencing Bimanual Visuomotor Policies with Object-Centric Motion Primitives},
author = {Yizhou Chen and Hang Xu and Dongjie Yu and Zeqing Zhang and Yi Ren and Jia Pan},
journal= {arXiv preprint arXiv:2506.18825},
year = {2025}
}
备注
Project website: https://sites.google.com/view/svip-bimanual