中文

在任务空间中训练以加速并引导强化学习

机器人学 2019-03-07 v1 机器学习 系统与控制

摘要

强化学习(RL)界近期的突破在学习并将策略部署于真实世界机器人系统方面取得了显著进展。然而,即便使用当前最先进的算法与计算资源,这些算法仍受高样本复杂度的困扰,从而训练时间长,尤其对于高自由度(DOF)系统。同时,涌现策略缺乏可感知的稳定性或鲁棒性保证也引发担忧。本文旨在通过以下方式缓解这些缺陷:(1)用具代表性的简单系统对复杂高DOF系统建模,(2)显式利用正运动学与逆运动学而不强迫RL算法自行“学习”它们,(3)在笛卡尔空间而非关节空间学习运动策略。本文将这些方法应用于JPL的Robosimian,但可轻易用于任何具基座与末端执行器的系统。这些运动策略可在几分钟内于单台笔记本电脑上训练得到。我们将所得学习策略的鲁棒性与其他控制方法进行比较。本文的附随视频见 https://youtu.be/xDxxSw5ahnc 。

关键词

引用

@article{arxiv.1903.02219,
  title  = {Training in Task Space to Speed Up and Guide Reinforcement Learning},
  author = {Guillaume Bellegarda and Katie Byl},
  journal= {arXiv preprint arXiv:1903.02219},
  year   = {2019}
}