面向机器人学的黑盒数据高效策略搜索
机器人学
2017-07-25 v2 机器学习
摘要
机器人学中数据效率最高的强化学习(RL)算法是基于不确定动力学模型的:在每个回合之后,它们首先学习机器人的动力学模型,然后使用优化算法在给定模型及其不确定性的情况下寻找最大化期望回报的策略。通常认为,只有使用基于解析梯度的算法,这种优化才是可处理的;然而,这些算法要求使用特定类别的奖励函数和策略,这极大地限制了整体方法的灵活性。在本文中,我们引入了一种新的基于模型的 RL 算法,称为 Black-DROPS(Black-box Data-efficient RObot Policy Search),它:(1) 对奖励函数或策略不施加任何约束(它们被视为黑盒),(2) 与机器人学中数据高效 RL 的 SOTA 算法具有同等的数据效率,并且 (3) 当有多个核心可用时,与解析方法一样快(或更快)。其核心思想是用一个考虑模型不确定性的并行黑盒算法来替代基于梯度的优化算法。我们在两个标准控制基准问题(仿真中)和一个低成本机械臂(真实机器人)上展示了我们新算法的性能。
引用
@article{arxiv.1703.07261,
title = {Black-Box Data-efficient Policy Search for Robotics},
author = {Konstantinos Chatzilygeroudis and Roberto Rama and Rituraj Kaushik and Dorian Goepp and Vassilis Vassiliades and Jean-Baptiste Mouret},
journal= {arXiv preprint arXiv:1703.07261},
year = {2017}
}
备注
Accepted at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2017; Code at http://github.com/resibots/blackdrops; Video at http://youtu.be/kTEyYiIFGPM