少样本下学习机器人控制器的策略搜索算法综述
机器人学
2019-12-05 v5 人工智能
机器学习
机器学习
摘要
大多数策略搜索算法需要数千次训练回合才能找到有效的策略,这对于物理机器人而言往往不可行。本综述文章聚焦于谱系的另一个极端:机器人如何仅通过少数几次试验(十几次)和几分钟时间实现自适应?类比“大数据”一词,我们将这一挑战称为“微数据强化学习”。我们指出,第一种策略是利用关于策略结构(例如动态运动基元)、策略参数(例如示范)或动力学(例如模拟器)的先验知识。第二种策略是建立期望奖励(例如贝叶斯优化)或动力学模型(例如基于模型的策略搜索)的数据驱动代理模型,从而使策略优化器查询模型而非真实系统。总体而言,所有成功的微数据算法都通过变换模型类型与先验知识来结合这两种策略。当前的科学挑战主要围绕扩展到复杂机器人(例如人形机器人)、设计通用先验以及优化计算时间而展开。
引用
@article{arxiv.1807.02303,
title = {A survey on policy search algorithms for learning robot controllers in a handful of trials},
author = {Konstantinos Chatzilygeroudis and Vassilis Vassiliades and Freek Stulp and Sylvain Calinon and Jean-Baptiste Mouret},
journal= {arXiv preprint arXiv:1807.02303},
year = {2019}
}
备注
21 pages, 3 figures, 4 algorithms, accepted at IEEE Transactions on Robotics