离屏最大熵强化学习:带优势加权混合策略的软 actor-critic(SAC-AWMP)
机器学习
2020-02-10 v1 人工智能
机器学习
摘要
强化学习问题的最优策略通常是非连续且非光滑的。即,对于两个表示相似的状态,其最优策略可能显著不同。在这种情况下,用对所有状态共享参数的函数近似器(FA)来表示整个策略可能并不理想,因为参数共享的泛化能力使得表示非连续、非光滑策略变得困难。解决此问题的一种常见方法称为混合专家,是将策略表示为多个分量的加权和,其中不同分量在状态空间的不同部分表现良好。遵循这一思想并受近期称为优势加权信息最大化的工作启发,我们提出为每个状态学习这些分量的权重,使它们包含状态本身的信息以及该状态迄今学到的偏好动作。动作偏好通过优势函数来刻画。在这种情况下,每个分量的权重仅对表示相似且偏好动作表示也相似的某些状态组较大。因此每个分量易于表示。我们将以此方式参数化的策略称为优势加权混合策略(AWMP),并将该思想应用于改进软 actor-critic(SAC)——最具竞争力的连续控制算法之一。实验结果表明,带 AWMP 的 SAC 在四个常用连续控制任务中明显优于 SAC,并在不同随机种子下取得稳定性能。
引用
@article{arxiv.2002.02829,
title = {Off-policy Maximum Entropy Reinforcement Learning : Soft Actor-Critic with Advantage Weighted Mixture Policy(SAC-AWMP)},
author = {Zhimin Hou and Kuangen Zhang and Yi Wan and Dongyu Li and Chenglong Fu and Haoyong Yu},
journal= {arXiv preprint arXiv:2002.02829},
year = {2020}
}