中文

策略拼接:学习可迁移的机器人策略

机器人学 2023-09-26 v1 系统与控制 系统与控制

摘要

使用强化学习(RL)训练机器人通常涉及与环境的重度交互,且习得的技能对任务环境和机器人运动学的变化往往敏感。迁移RL旨在利用先前的知识来加速新任务或新机体配置的学习。然而,现有方法由于复杂的架构设计或限制所学策略容量的强正则化,难以泛化到新颖的机器人-任务组合,也难以扩展到实际任务。我们提出策略拼接(Policy Stitching),一种促进机器人针对新颖机器人与任务组合进行迁移学习的新型框架。我们的核心思想是应用模块化策略设计并对模块接口间的潜在表示进行对齐。我们的方法允许直接拼接分别训练的机器人和任务模块,以形成用于快速适应的新策略。我们在多种3D操控任务上的仿真和真实世界实验展示了我们方法的优越零样本和少样本迁移学习性能。我们的项目网站为:http://generalroboticslab.com/PolicyStitching/ 。

关键词

引用

@article{arxiv.2309.13753,
  title  = {Policy Stitching: Learning Transferable Robot Policies},
  author = {Pingcheng Jian and Easop Lee and Zachary Bell and Michael M. Zavlanos and Boyuan Chen},
  journal= {arXiv preprint arXiv:2309.13753},
  year   = {2023}
}

备注

CoRL 2023