使用强化学习的深度预测策略训练
机器人学
2017-03-03 v1
摘要
由于感觉运动过程的固有延迟,熟练的机器人任务学习最好通过预测性动作策略来实现。然而,训练此类预测策略具有挑战性,因为它涉及在整个动作持续时间内寻找一条运动激活轨迹。我们提出了一种数据高效的深度预测策略训练(DPPT)框架,该框架采用一种深度神经网络策略架构,将图像观测映射为运动激活序列。该架构由三个子网络组成,分别称为感知、策略和行为超层。感知和行为超层分别利用合成和模拟训练样本,强制对视觉和运动数据进行抽象。策略超层是一个参数较少的小型子网络,负责在抽象流形之间进行数据映射。它使用策略搜索强化学习方法针对每个任务进行训练。我们通过在 PR2 机器人上训练用于熟练物体抓取和投球的预测策略,展示了所提架构和学习框架的适用性。这些任务仅需约 180 次真实机器人尝试及定性终端奖励即可完成训练,这一事实证明了该方法的有效性。
引用
@article{arxiv.1703.00727,
title = {Deep Predictive Policy Training using Reinforcement Learning},
author = {Ali Ghadirzadeh and Atsuto Maki and Danica Kragic and Mårten Björkman},
journal= {arXiv preprint arXiv:1703.00727},
year = {2017}
}
备注
This work is submitted to IEEE/RSJ International Conference on Intelligent Robots and Systems 2017 (IROS2017)