中文

基于深度强化学习与知识迁移的灵巧机械臂复杂稀疏奖励任务操控

机器人学 2023-01-31 v2 机器学习

摘要

本文描述了一种在2021年真实机器人挑战赛(RRC)第一阶段中获胜的深度强化学习(DRL)方法,并将该方法扩展至更困难的操控任务。RRC要求使用TriFinger机器人沿指定位置轨迹操控一个立方体,但不要求立方体具有任何特定朝向。我们采用了相对简单的奖励函数,即基于目标的稀疏奖励与距离奖励的组合,并结合事后经验回放(HER)来引导DRL智能体(深度确定性策略梯度(DDPG))的学习。我们的方法使智能体能够在仿真中习得灵巧机械臂操控策略。这些策略随后被应用于真实机器人,并在RRC的最终评估阶段优于所有其他参赛方案,包括那些使用更传统机器人控制技术的方案。在此,我们通过修改RRC第一阶段的任务来扩展该方法,要求机器人在沿所需位置轨迹移动立方体的同时,保持立方体处于特定朝向。由于问题复杂度增加,同时要求立方体朝向使得智能体无法通过盲目探索来学习任务。为规避此问题,我们新颖地使用了一种知识迁移(KT)技术,使智能体在原始任务(与立方体朝向无关)中习得的策略能够迁移到该任务(朝向有关)中。KT使智能体能够在模拟器中学习并执行扩展任务,在评估中将平均位置偏差从0.134 m改善至0.02 m,平均朝向偏差从142°改善至76°。该KT概念展现出良好的泛化特性,可应用于任何 actor-critic 学习算法。

关键词

引用

@article{arxiv.2205.09683,
  title  = {Dexterous Robotic Manipulation using Deep Reinforcement Learning and Knowledge Transfer for Complex Sparse Reward-based Tasks},
  author = {Qiang Wang and Francisco Roldan Sanchez and Robert McCarthy and David Cordova Bulens and Kevin McGuinness and Noel O'Connor and Manuel Wüthrich and Felix Widmaier and Stefan Bauer and Stephen J. Redmond},
  journal= {arXiv preprint arXiv:2205.09683},
  year   = {2023}
}

备注

This paper has been summited to Expert Systems: the Journal of Knowledge Engineering for reviewing. arXiv admin note: text overlap with arXiv:2109.15233