通过生成式运动反射以引导策略搜索学习鲁棒操作技能
机器人学
2019-02-20 v2 人工智能
摘要
引导策略搜索(Guided Policy Search)使机器人能够高效学习复杂操作任务的控制策略。其中,控制策略被表示为基于状态推导机器人动作的高维神经网络。然而,由于引导策略搜索中真实世界轨迹样本数量较少,所得的神经网络仅在真实世界交互所探索的轨迹分布邻域内鲁棒。本文提出一种称为生成式运动反射(Generative Motor Reflexes)的新策略表示,与先前方法相比,它能够在更广阔的状态空间上生成鲁棒动作。与先前的状态-动作策略不同,生成式运动反射将状态映射为依赖于状态的运动反射的参数,再由此推导动作。鲁棒性通过对许多状态生成相似的运动反射来实现。我们在模拟与真实世界操作任务(包括富接触的插孔任务)中评估了所提方法。利用这些评估任务,我们表明表示为生成式运动反射的策略能够在探索过的轨迹分布之外产生鲁棒的操作技能,且相比先前方法训练需求更少。
引用
@article{arxiv.1809.05714,
title = {Learning Robust Manipulation Skills with Guided Policy Search via Generative Motor Reflexes},
author = {Philipp Ennen and Pia Bresenitz and Rene Vossen and Frank Hees},
journal= {arXiv preprint arXiv:1809.05714},
year = {2019}
}
备注
IEEE International Conference on Robotics and Automation (ICRA) 2019