中文

如何分配你的机器人时间:为基于视觉的机器人操作桥接启动与离线强化学习

机器人学 2022-05-09 v1 机器学习

摘要

强化学习(RL)已被证明能从经验中有效学习控制。然而,RL 通常需要与环境进行大量在线交互。这限制了其在现实场景中的适用性,例如在机器人领域,此类交互成本高昂。在这项工作中,我们研究了如何通过重用我们可能获得的次优策略(例如来自相关先验任务的训练,或在仿真中)来最小化目标任务中的在线交互。为此,我们开发了两种 RL 算法,它们不仅可以使用教师策略的动作分布,还可以使用这些策略在目标任务上收集的数据来加速训练。我们就如何在基于视觉的多样物体堆叠这一具有挑战性的机器人操作基准上使用次优教师进行了透彻的实验研究。我们将我们的方法与离线、在线、离线到在线以及启动(kickstarting)RL 算法进行比较。通过这样做,我们发现,在教师和学生数据上同时训练,能在有限数据预算下实现最佳性能。我们考察了如何在教师和学生策略之间最佳分配目标任务上的有限数据预算,并报告了使用不同预算、两个具有不同次优程度的教师以及五个需要多样行为的堆叠任务的实验。我们在仿真和真实世界中的分析表明,我们的方法在不同数据预算下均为最佳,而令人惊讶的是,当给定足够数据时,基于教师 rollout 的标准离线 RL 非常有效。

关键词

引用

@article{arxiv.2205.03353,
  title  = {How to Spend Your Robot Time: Bridging Kickstarting and Offline Reinforcement Learning for Vision-based Robotic Manipulation},
  author = {Alex X. Lee and Coline Devin and Jost Tobias Springenberg and Yuxiang Zhou and Thomas Lampe and Abbas Abdolmaleki and Konstantinos Bousmalis},
  journal= {arXiv preprint arXiv:2205.03353},
  year   = {2022}
}