中文

通过终端状态正则化实现长时程机器人操作的对抗性技能链接

机器学习 2021-11-16 v1 人工智能 机器人学

摘要

技能链接是一种通过顺序组合先前学习的技能来合成复杂行为的有前途的方法。然而,当策略遇到其训练期间从未见过的起始状态时,技能的简单组合会失败。为了成功实现技能链接,先前的方法试图扩大策略的起始状态分布。然而,随着更多策略被按顺序排列,这些方法要求覆盖更大的状态分布,因此仅限于短技能序列。在本文中,我们提出通过在对抗性学习框架中正则化终端状态分布,来链接多个策略而无需过大的初始状态分布。我们在两个复杂的家具组装长时程操作任务上评估了我们的方法。我们的结果表明,我们的方法建立了第一个解决这些任务的无模型强化学习算法;而先前的技能链接方法则失败了。代码和视频可在 https://clvrai.com/skill-chaining 获取。

关键词

引用

@article{arxiv.2111.07999,
  title  = {Adversarial Skill Chaining for Long-Horizon Robot Manipulation via Terminal State Regularization},
  author = {Youngwoon Lee and Joseph J. Lim and Anima Anandkumar and Yuke Zhu},
  journal= {arXiv preprint arXiv:2111.07999},
  year   = {2021}
}

备注

Published at the Conference on Robot Learning (CoRL) 2021