利用基础控制器学习长时序稀疏奖励机械臂任务
机器人学
2021-12-07 v3 计算机视觉与模式识别
摘要
深度强化学习(DRL)使机器人能够端到端地执行一些智能任务。然而,对于长时序稀疏奖励的机械臂任务仍存在诸多挑战。一方面,稀疏奖励设定导致探索效率低下。另一方面,使用物理机器人进行探索成本高且不安全。在本文中,我们提出一种利用一个或多个已有的传统控制器(本文称之为基础控制器)来学习长时序稀疏奖励任务的方法。基于深度确定性策略梯度(DDPG),我们的算法将已有的基础控制器融入探索、价值学习与策略更新阶段。此外,我们给出了一种直接合成不同基础控制器以整合其优势的方式。通过从堆叠积木到杯子的实验表明,所学到的基于状态或基于图像的策略稳定优于基础控制器。与先前从演示中学习的工作相比,我们的方法将样本效率提升了数个数量级并改善了性能。总体而言,我们的方法具有利用现有工业机械臂操控系统构建更灵活、更智能控制器的潜力。
引用
@article{arxiv.2011.12105,
title = {Learning of Long-Horizon Sparse-Reward Robotic Manipulator Tasks with Base Controllers},
author = {Guangming Wang and Minjian Xin and Wenhua Wu and Zhe Liu and Hesheng Wang},
journal= {arXiv preprint arXiv:2011.12105},
year = {2021}
}
备注
10 pages, 6 figures, under review