中文

基于迭代强化学习的Cassie动态运动技能设计

机器人学 2019-03-25 v1

摘要

深度强化学习(DRL)是开发腿式运动技能的一种有前景的方法。然而,实践中不可避免的迭代设计过程在默认方法论下得不到良好支持。很难预测对奖励函数、策略架构以及所训练任务集合的改动所带来的结果。本文提出一种实用方法,允许在每次连续设计迭代中完全重新定义奖励函数,同时限制与先前迭代的偏离。我们通过确定性动作随机状态(DASS)元组集合来刻画策略,该集合表示由训练所得随机策略访问的状态中采样得到的确定性策略状态-动作对。新策略使用策略梯度算法训练,该算法将基于强化学习的策略梯度与由DASS元组定义的梯度更新相混合。这些元组还允许向新网络架构进行鲁棒的策略蒸馏。我们在双足机器人Cassie上证明了该迭代设计方法的有效性,实现了不同步态风格、多种速度下的稳定行走。我们展示了在仿真中学习的策略无需任何动力学随机化即可成功迁移至实体机器人,且实体机器人的变速行走策略可由5-10k元组的较小数据集表示。

关键词

引用

@article{arxiv.1903.09537,
  title  = {Iterative Reinforcement Learning Based Design of Dynamic Locomotion Skills for Cassie},
  author = {Zhaoming Xie and Patrick Clary and Jeremy Dao and Pedro Morais and Jonathan Hurst and Michiel van de Panne},
  journal= {arXiv preprint arXiv:1903.09537},
  year   = {2019}
}