带熵正则化的策略优化强化学习
机器学习
2020-10-19 v3 人工智能
机器学习
摘要
熵正则化是强化学习中的一个重要思想,在软 Q 网络(SQN)和软演员-评论家(SAC1)等近期算法中取得了巨大成功。在本工作中,我们将该思想扩展到同策略(on-policy)领域。我们提出了用于同策略最大熵强化学习的软策略梯度定理(SPGT)。借助 SPGT,导出了一系列新的策略优化算法,如 SPG、SA2C、SA3C、SDDPG、STRPO、SPPO、SIMPALA 等。我们发现 SDDPG 等价于 SAC1。对于策略梯度,策略网络通常表示为具有全局动作方差的高斯分布,这损害了表示能力。我们为策略网络引入了局部动作方差,并发现其可与熵正则化思想协同工作。我们的方法在一系列基准任务上优于先前工作。此外,我们的方法可轻松扩展至大规模实验,并具有出色的稳定性和并行性。
引用
@article{arxiv.1912.01557,
title = {Policy Optimization Reinforcement Learning with Entropy Regularization},
author = {Jingbin Liu and Xinyang Gu and Shuai Liu},
journal= {arXiv preprint arXiv:1912.01557},
year = {2020}
}