中文

奖励自适应强化学习:用于双足运动控制的动态策略梯度优化

机器人学 2021-12-23 v2

摘要

由于涉及复杂动力学与多准则优化,控制非静态双足机器人具有挑战性。近期工作已证明深度强化学习(DRL)对仿真与实体机器人的有效性。在这些方法中,来自不同准则的奖励通常被求和以学习单一值函数。然而,这可能导致混合奖励间依赖信息的丢失并导致次优策略。本文提出一种新颖的用于双足运动的奖励自适应强化学习,通过动态机制使控制策略能被多准则同时优化。所提方法采用多头评论家为每个奖励分量学习独立的值函数,由此产生混合策略梯度。我们进一步提出动态权重,使各分量能以不同优先级优化策略。这种混合动态策略梯度(HDPG)设计使智能体学习更高效。我们表明所提方法优于求和奖励方法,且能迁移至实体机器人。sim-to-real 与 MuJoCo 结果进一步证明了 HDPG 的有效性与泛化能力。

关键词

引用

@article{arxiv.2107.01908,
  title  = {Reward-Adaptive Reinforcement Learning: Dynamic Policy Gradient Optimization for Bipedal Locomotion},
  author = {Changxin Huang and Guangrun Wang and Zhibo Zhou and Ronghui Zhang and Liang Lin},
  journal= {arXiv preprint arXiv:2107.01908},
  year   = {2021}
}