中文

从次优专家学习灵巧操作

机器人学 2021-01-06 v2 人工智能

摘要

在高维状态-动作空间中学习灵巧操作是一个重要的开放挑战,其中探索构成主要瓶颈。尽管在许多情况下学习过程可由示范或其他次优专家引导,当前用于连续动作空间的 RL 算法常未能有效利用高度离策的专家数据与同策探索数据的组合。作为解决方案,我们引入相对熵 Q 学习(REQ),一种简单的策略迭代算法,它融合了成功离线与常规 RL 算法的思想。它通过从所学先验的重要性采样表示最优策略,并善于利用混合数据分布。我们通过实验证明,在可获取次优专家的机器人操作任务上,REQ 优于若干强基线。我们展示了如何通过组合简单路点跟踪控制器有效构造次优专家,并展示了如何将所学基元与路点控制器结合以获得参考行为,从而在具有类人手的模拟双手机器人上引导复杂操作任务。最后,我们展示 REQ 对于通用离策 RL、离线 RL 及从示范的 RL 同样有效。视频与进一步材料见 sites.google.com/view/rlfse。

关键词

引用

@article{arxiv.2010.08587,
  title  = {Learning Dexterous Manipulation from Suboptimal Experts},
  author = {Rae Jeong and Jost Tobias Springenberg and Jackie Kay and Daniel Zheng and Yuxiang Zhou and Alexandre Galashov and Nicolas Heess and Francesco Nori},
  journal= {arXiv preprint arXiv:2010.08587},
  year   = {2021}
}