中文

几何感知策略模仿

机器人学 2025-10-13 v1

摘要

我们提出一种几何感知策略模仿(GPI)方法,通过将演示视为几何曲线而非状态-动作样本集合来重新构思imitation学习。从这些曲线中,GPI推导出距离场,从而产生两种互补的控制原语:一种沿专家轨迹推进的progress flow,以及一种纠正偏差的吸引 flow。它们的组合定义了一个可控的、非参数的向量场,直接指导机器人行为。该表述将度量学习与策略合成解耦,使其能够在低维机器人状态和高维感知输入之间实现模块化适应。GPI通过保留各个演示作为独立模型来自然支持多模态性,并通过简单地添加到距离场中来高效地组合新的演示。我们在仿真和实际机器人上对GPI进行了测试。实验表明,GPI的成功率高于基于扩散的策略,运行速度快20倍,所需内存更少,并且对扰动具有鲁棒性。这些结果表明,GPI是一种高效、可解释且可扩展的机器人imitation学习的替代方案,作为替代生成方法。项目网站:https://yimingli1998.github.io/projects/GPI/。

关键词

引用

@article{arxiv.2510.08787,
  title  = {Geometry-aware Policy Imitation},
  author = {Yiming Li and Nael Darwiche and Amirreza Razmjoo and Sichao Liu and Yilun Du and Auke Ijspeert and Sylvain Calinon},
  journal= {arXiv preprint arXiv:2510.08787},
  year   = {2025}
}

备注

21 pages, 13 figures. In submission