中文

CPG-ACTOR:面向中枢模式发生器的强化学习

机器人学 2021-02-26 v1

摘要

中枢模式发生器(CPGs)具有若干适于运动控制的理想性质:它们生成平滑轨迹、对扰动具有鲁棒性且易于实现。尽管在概念上前景可期,我们认为 CPGs 的全部潜力迄今受限于感官反馈信息的不足。本文提出一种新方法,允许在强化学习(RL)设定下通过基于梯度的优化来调谐 CPG 控制器。据我们所知,这是首次在深度 RL 背景下将 CPGs 与多层感知机(MLP)网络联合训练。特别地,我们展示了 CPGs 如何能直接作为 Actor-Critic 公式中的 Actor 集成。此外,我们证明了这一改变如何使我们能够集成来自感官知觉的高度非线性反馈以重塑振荡器的动力学。我们在使用单腿跳跃器的运动任务上的结果表明,显式地将 CPG 用作 Actor 而非环境的一部分,相较于先前方法带来了随时间获得的奖励的显著提升(多出 6 倍)。此外,我们展示了无反馈的我们的方法复现了类似于先前有反馈工作的结果。最后,我们展示了我们的闭环 CPG 如何仅依赖基本奖励函数,在更长训练周期中逐步改善跳跃行为。

关键词

引用

@article{arxiv.2102.12891,
  title  = {CPG-ACTOR: Reinforcement Learning for Central Pattern Generators},
  author = {Luigi Campanaro and Siddhant Gangapurwala and Daniele De Martini and Wolfgang Merkt and Ioannis Havoutis},
  journal= {arXiv preprint arXiv:2102.12891},
  year   = {2021}
}