中文

分布软 actor-critic:用于解决价值估计误差的离策略强化学习

机器学习 2021-06-14 v3 人工智能 系统与控制 系统与控制

摘要

在强化学习(RL)中,函数近似误差已知容易引发 Q 值高估,从而大幅降低策略性能。本文提出一种分布软 actor-critic(DSAC)算法,这是一种面向连续控制设置的离策略 RL 方法,通过缓解 Q 值高估来提升策略性能。我们首先在理论上发现,学习状态-动作回报的分布函数能够有效缓解 Q 值高估,因为其能够自适应调整 Q 值函数的更新步长。随后,通过将回报分布函数嵌入最大熵 RL,发展了分布软策略迭代(DSPI)框架。最后,我们给出 DSPI 的深度离策略 actor-critic 变体,称为 DSAC,其通过保持状态-动作回报的方差在合理范围内直接学习连续回报分布,以解决梯度爆炸和消失问题。我们在 MuJoCo 连续控制任务套件上评估 DSAC,取得了最先进的性能。

关键词

引用

@article{arxiv.2001.02811,
  title  = {Distributional Soft Actor-Critic: Off-Policy Reinforcement Learning for Addressing Value Estimation Errors},
  author = {Jingliang Duan and Yang Guan and Shengbo Eben Li and Yangang Ren and Bo Cheng},
  journal= {arXiv preprint arXiv:2001.02811},
  year   = {2021}
}