中文

基于深度强化学习引导式贝叶斯策略搜索的机器人生存控制

机器人学 2021-07-01 v1

摘要

许多机器人操作技能可以用确定性特征表示,并且存在高效的技术来学习这些技能的参数化运动规划。然而,在机械故障情况下维持操作能力仍是一个活跃的研究挑战。理想情况下,像生物有机体一样,机器人智能体应能够通过适应动态对抗环境来重新配置其控制策略。在本文中,我们提出了一种方法,使智能体能够在机械损失情况下生存,并自适应地学习具有受损自由度的操作——我们称我们的方法为可生存机器人学习(SRL)。我们的核心思想是利用贝叶斯策略梯度,通过在后验估计中编码知识偏置,从而在样本效率方面减轻未来的策略搜索探索,并与基于随机探索的策略搜索方法相比具有优势。SRL将策略先验表示为高斯过程,通过将从先验回放中引导的偏置作为代理,允许在真实梯度难以处理时近似后验的可处理计算。我们将所提方法与现成的无模型学习算法(DDPG)进行评估对比,在遭遇渐进式故障模拟的六足机器人平台上进行测试,实验表明我们的方法在所有故障模式下在样本需求和定量成功率方面均有大幅改进。我们实验的演示视频可查看:https://sites.google.com/view/survivalrl

关键词

引用

@article{arxiv.2106.15653,
  title  = {Survivable Robotic Control through Guided Bayesian Policy Search with Deep Reinforcement Learning},
  author = {Sayyed Jaffar Ali Raza and Apan Dastider and Mingjie Lin},
  journal= {arXiv preprint arXiv:2106.15653},
  year   = {2021}
}

备注

6 pages, published in CASE 2021 as regular paper