中文

SPIRE: 面向长时程操作的协同规划、模仿与强化学习

机器人学 2024-10-24 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

机器人学习已被证明是一种通用且有效的机械臂编程技术。模仿学习能够仅凭人类示教来训练机器人,但其能力受限于示教的质量。强化学习通过探索来发现更优的行为;然而,可能的改进空间可能过大,难以从零开始。对于这两种技术,学习难度随操作任务长度的增加而增加。鉴于此,我们提出了 SPIRE 系统,该系统首先使用任务与运动规划(TAMP)将任务分解为更小的学习子问题,然后结合模仿学习和强化学习以最大化它们的优势。我们开发了新颖的策略,用于在规划系统的上下文中训练学习智能体。我们在一个包含长时程和强接触的机器人操作问题套件上评估了 SPIRE。我们发现,SPIRE 在平均任务性能上比先前整合模仿学习、强化学习和规划的方法高出 35% 到 50%,在训练熟练智能体所需的人类示教数量上数据效率提高了 6 倍,并且学习完成任务的速度几乎快了一倍。更多详情请访问 https://sites.google.com/view/spire-corl-2024。

关键词

引用

@article{arxiv.2410.18065,
  title  = {SPIRE: Synergistic Planning, Imitation, and Reinforcement Learning for Long-Horizon Manipulation},
  author = {Zihan Zhou and Animesh Garg and Dieter Fox and Caelan Garrett and Ajay Mandlekar},
  journal= {arXiv preprint arXiv:2410.18065},
  year   = {2024}
}

备注

Conference on Robot Learning (CoRL) 2024