从单个演示到接触丰富操作的通用策略
机器人学
2026-05-19 v1
摘要
我们提出了一种学习从演示 (LfD) 框架,能够在多阶段、接触丰富的操作任务中实现一次性泛化。我们方法的核心是利用环境约束作为归纳偏置。通过将演示表示为利用环境约束的一系列行为来分离任务通用结构——约束类型及其转换——与实例特定细节,如精确的演示轨迹、姿态和局部几何形状。我们的四阶段管道在该表示上构建完整的策略:机器人首先将单个演示抽象为环境约束原语,然后通过自导探索来消除歧义,随后吸收针对超出分布变化的有针对性的人类纠正,最后通过顺从交互在线恢复被抽象掉的细节。由于所得策略遵循约束而非模仿轨迹,因此它能够在对象姿态、局部几何形状和未建模的接触动力学之间进行泛化。我们在七个真实世界的多阶段接触丰富操作任务上进行了验证,成功率超过 90%。这些广泛的实验结果确立了环境约束作为高效泛化学习从演示中提取的基本构建块。
引用
@article{arxiv.2605.17601,
title = {From a Single Demonstration to a General Policy for Contact-Rich Manipulation},
author = {Xing Li and Oliver Brock},
journal= {arXiv preprint arXiv:2605.17601},
year = {2026}
}
备注
21 pages, 22 figures, 7 tables