提升 Soft Actor-Critic:强调近期经验而不遗忘过去
机器学习
2019-06-11 v1 人工智能
机器学习
摘要
Soft Actor-Critic (SAC) 是一种基于最大熵强化学习的离策略 actor-critic 深度强化学习 (DRL) 算法。通过将离策略更新与 actor-critic 表述相结合,SAC 在一系列连续动作基准任务上达到了最先进的性能,优于先前的同策略和离策略方法。SAC 采用的离策略方法在执行参数更新时从过去经验中均匀采样数据。我们提出强调近期经验 (ERE),一种简单但强大的离策略采样技术,它强调最近观测到的数据同时不遗忘过去。ERE 算法更积极地从近期经验中采样,并且对更新进行排序以确保来自旧数据的更新不会覆盖来自新数据的更新。我们比较了原始 SAC 和 SAC+ERE,并表明对于连续动作 Mujoco 任务,ERE 比原始 SAC 具有更高的样本效率。我们还考虑将 SAC 与优先经验回放 (PER) 结合,PER 是一种最初为深度 Q 学习提出的、基于时序差分 (TD) 误差对数据进行优先排序的方案。我们表明 SAC+PER 能略微提升 SAC 的样本效率表现,但远不如 SAC+ERE。最后,我们提出一种集成 ERE 与 PER 的算法,并表明该混合算法在部分 Mujoco 任务上能给出最佳结果。
引用
@article{arxiv.1906.04009,
title = {Boosting Soft Actor-Critic: Emphasizing Recent Experience without Forgetting the Past},
author = {Che Wang and Keith Ross},
journal= {arXiv preprint arXiv:1906.04009},
year = {2019}
}