用于最大熵深度强化学习的软策略梯度方法
机器学习
2019-09-10 v1 人工智能
机器学习
摘要
最大熵深度强化学习(RL)方法已在一系列具有挑战性的连续任务中得到验证。然而,现有方法要么在大量离线策略数据上训练时遭受严重的不稳定性,要么无法扩展到具有非常高状态和动作维度的任务,如3D人形运动。此外,为非最优软价值函数设定的期望玻尔兹曼策略集的最优性说服力不足。在本文中,我们首先基于熵正则化期望奖励目标,为连续动作的强化学习推导出软策略梯度。然后,我们通过将软策略梯度与软贝尔曼方程相结合,提出了一种离线策略演员-评论家、无模型的最大熵深度强化学习算法,称为深度软策略梯度(DSPG)。为了确保稳定学习,同时消除对两个独立评论家用于软价值函数的需求,我们利用双重采样方法使软贝尔曼方程易于处理。实验结果表明,我们的方法在性能上优于先前的离线策略方法。
引用
@article{arxiv.1909.03198,
title = {Soft Policy Gradient Method for Maximum Entropy Deep Reinforcement Learning},
author = {Wenjie Shi and Shiji Song and Cheng Wu},
journal= {arXiv preprint arXiv:1909.03198},
year = {2019}
}
备注
to be published in Proceedings of the Twenty-Eighth International Joint Conference on Artificial Intelligence (IJCAI-19)