分布软 actor-critic:用于解决价值估计误差的离策略强化学习
机器学习
2021-06-14 v3 人工智能
系统与控制
系统与控制
摘要
在强化学习(RL)中,函数近似误差已知容易引发 Q 值高估,从而大幅降低策略性能。本文提出一种分布软 actor-critic(DSAC)算法,这是一种面向连续控制设置的离策略 RL 方法,通过缓解 Q 值高估来提升策略性能。我们首先在理论上发现,学习状态-动作回报的分布函数能够有效缓解 Q 值高估,因为其能够自适应调整 Q 值函数的更新步长。随后,通过将回报分布函数嵌入最大熵 RL,发展了分布软策略迭代(DSPI)框架。最后,我们给出 DSPI 的深度离策略 actor-critic 变体,称为 DSAC,其通过保持状态-动作回报的方差在合理范围内直接学习连续回报分布,以解决梯度爆炸和消失问题。我们在 MuJoCo 连续控制任务套件上评估 DSAC,取得了最先进的性能。
引用
@article{arxiv.2001.02811,
title = {Distributional Soft Actor-Critic: Off-Policy Reinforcement Learning for Addressing Value Estimation Errors},
author = {Jingliang Duan and Yang Guan and Shengbo Eben Li and Yangang Ren and Bo Cheng},
journal= {arXiv preprint arXiv:2001.02811},
year = {2021}
}