中文

基于运动基元的深度黑盒强化学习

机器学习 2022-10-19 v1 人工智能 机器人学

摘要

基于回合的强化学习(ERL)算法将强化学习(RL)视为黑盒优化问题,即针对称为上下文的给定任务描述符,学习选取常由运动基元表示的控制器参数向量。与基于步的 RL 相比,ERL 具有若干显著优势:它生成平滑的控制轨迹,可处理非马尔可夫奖励定义,且参数空间中的探索非常适合求解稀疏奖励设定。然而,运动基元参数的高维性迄今阻碍了深度 RL 方法的有效使用。本文提出一种用于深度 ERL 的新算法。它基于可微信赖域层——一种成功的同策略深度 RL 算法。这些层使我们能够为策略更新指定信赖域,并对每个状态使用凸优化精确求解,从而支持 ERL 所需的高精度策略学习。我们在多个复杂模拟机器人控制任务中将 ERL 算法与最先进的基于步的算法进行比较。在此过程中,我们考察了不同的奖励形式——稠密、稀疏与非马尔可夫。基于步的算法仅在稠密奖励上表现良好,而 ERL 在稀疏与非马尔可夫奖励上表现更优。此外,我们的结果表明,稀疏与非马尔可夫奖励也常更适合定义期望行为,使我们相较基于步的 RL 获得质量显著更高的策略。

关键词

引用

@article{arxiv.2210.09622,
  title  = {Deep Black-Box Reinforcement Learning with Movement Primitives},
  author = {Fabian Otto and Onur Celik and Hongyi Zhou and Hanna Ziesche and Ngo Anh Vien and Gerhard Neumann},
  journal= {arXiv preprint arXiv:2210.09622},
  year   = {2022}
}

备注

Accepted at CoRL 2022