中文

利用参数化黑盒先验扩展机器人基于模型的策略搜索

机器人学 2018-03-14 v2 人工智能 机器学习 神经与进化计算 机器学习

摘要

机器人强化学习中数据效率最高的算法是基于模型的策略搜索算法,该算法在学习机器人动力学模型与优化策略以在给定模型及其不确定性的情况下最大化预期回报之间交替进行。在少数已提出的方法中,最近引入的 Black-DROPS 算法利用黑盒优化算法,在使用多个核心时实现了高数据效率和良好的计算时间;然而,与所有基于模型的策略搜索方法一样,Black-DROPS 无法扩展到高维状态/动作空间。在本文中,我们引入了一种新的 Black-DROPS 模型学习程序,该程序利用参数化黑盒先验来(1)扩展至高维系统,并(2)对先验信息的严重不准确保持鲁棒性。我们通过仿真中的“pendubot”摇起任务以及一个必须尽可能快地向前行走的物理六足机器人(48D 状态空间,18D 动作空间)验证了我们方法的有效性。结果表明,我们新算法的数据效率高于先前的基于模型的策略搜索算法(包含和不包含先验),并且它允许物理六足机器人仅需 16 到 30 秒的交互时间即可学习新的步态。

关键词

引用

@article{arxiv.1709.06917,
  title  = {Using Parameterized Black-Box Priors to Scale Up Model-Based Policy Search for Robotics},
  author = {Konstantinos Chatzilygeroudis and Jean-Baptiste Mouret},
  journal= {arXiv preprint arXiv:1709.06917},
  year   = {2018}
}

备注

Accepted at ICRA 2018; 8 pages, 4 figures, 2 algorithms, 1 table; Video at https://youtu.be/HFkZkhGGzTo ; Spotlight ICRA presentation at https://youtu.be/_MZYDhfWeLc