通过深度强化学习实现机械臂控制与任务训练
机器人学
2020-05-07 v1 人工智能
摘要
本文针对机械臂完成操作任务(如到达随机目标位姿以及拾取并放置物体)的问题,对信赖域策略优化(TRPO)与带归一化优势函数的 DeepQ-Network(NAF)同其他先进算法(即深度确定性策略梯度 DDPG 和 Vanilla 策略梯度 VPG)进行了详尽广泛的比较。比较表明,在要求机械臂完成上述操作任务时,前者的表现优于后者。我们提供了仿真与真实世界两类实验。仿真使我们展示了为精确估计算法超参数和正确设计良好策略所采用的步骤。真实世界实验表明,我们的策略若在仿真中经过正确训练,几乎无需修改即可迁移并部署于真实环境中执行。
引用
@article{arxiv.2005.02632,
title = {Robotic Arm Control and Task Training through Deep Reinforcement Learning},
author = {Andrea Franceschetti and Elisa Tosello and Nicola Castaman and Stefano Ghidoni},
journal= {arXiv preprint arXiv:2005.02632},
year = {2020}
}
备注
Submitted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2018