中文

Soft Actor-Critic:基于随机 actor 的离策略最大熵深度强化学习

机器学习 2018-08-10 v2 人工智能 机器学习

摘要

无模型深度强化学习(RL)算法已在一系列具有挑战性的决策与控制任务上得到验证。然而,这些方法通常面临两个主要挑战:极高的样本复杂度和脆弱的收敛性质,这需要精细的超参数调优。这两个挑战严重限制了此类方法在复杂真实世界领域的适用性。本文中,我们提出 soft actor-critic,一种基于最大熵强化学习框架的离策略 actor-critic 深度 RL 算法。在该框架中,actor 旨在最大化期望奖励的同时最大化熵。即,在完成任务的同时尽可能随机地行动。先前基于该框架的深度 RL 方法被表述为 Q-learning 方法。通过将离策略更新与稳定的随机 actor-critic 公式相结合,我们的方法在一系列连续控制基准任务上取得了 state-of-the-art 性能,优于先前的 on-policy 与 off-policy 方法。此外,我们证明,与其他 off-policy 算法不同,我们的方法非常稳定,在不同随机种子下取得了非常相似的性能。

关键词

引用

@article{arxiv.1801.01290,
  title  = {Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor},
  author = {Tuomas Haarnoja and Aurick Zhou and Pieter Abbeel and Sergey Levine},
  journal= {arXiv preprint arXiv:1801.01290},
  year   = {2018}
}

备注

ICML 2018 Videos: sites.google.com/view/soft-actor-critic Code: github.com/haarnoja/sac