中文

在软 actor-critic 中使用标准化流策略改进探索

机器学习 2019-06-10 v1 人工智能 机器学习

摘要

已知连续动作空间的深度强化学习(DRL)算法对超参数脆弱且样本效率低。软 Actor Critic(SAC)在最大熵 RL 框架内提出了一种离策略深度 actor critic 算法,提供了更好的稳定性与经验增益。策略分布的选择(因子化高斯)是因其易于重参数化而非建模能力所驱动。我们在 SAC 框架内引入标准化流(Normalizing Flow)策略,其学习比简单因子化高斯更具表达力的策略类。我们在连续网格世界任务上经验性地表明,我们的方法提升了稳定性,并且更适用于稀疏奖励设置下的困难探索。

关键词

引用

@article{arxiv.1906.02771,
  title  = {Improving Exploration in Soft-Actor-Critic with Normalizing Flows Policies},
  author = {Patrick Nadeem Ward and Ariella Smofsky and Avishek Joey Bose},
  journal= {arXiv preprint arXiv:1906.02771},
  year   = {2019}
}

备注

INNF workshop, International Conference on Machine Learning 2019, Long Beach CA, USA