通过归一化流在离策略算法中利用探索
机器学习
2019-09-25 v3 机器学习
摘要
在具有稀疏奖励的领域中发现近似最优策略的能力,对于将强化学习(RL)应用于许多现实场景至关重要。已有方法如神经密度模型和连续探索(例如 Go-Explore)被提出,以维持发现高性能且可泛化策略所需的高探索率。软演员-评论家(SAC)是另一种改进探索的方法,旨在通过对离策略更新进行高效学习的同时最大化策略熵。在这项工作中,我们通过归一化流(NF)将 SAC 扩展到更丰富的概率分布类(例如多模态分布),并表明这通过使用小得多的策略表示加速发现良好策略而显著提升了性能。我们的方法称为 SAC-NF,是对 SAC 在连续控制基准(如 MuJoCo 和 PyBullet Roboschool 领域)上的一个简单、高效、易于实现的修改与改进。最后,SAC-NF 在显著参数高效的情况下实现这一点,所用参数仅为等效 SAC 模型的 5.5%。
引用
@article{arxiv.1905.06893,
title = {Leveraging exploration in off-policy algorithms via normalizing flows},
author = {Bogdan Mazoure and Thang Doan and Audrey Durand and R Devon Hjelm and Joelle Pineau},
journal= {arXiv preprint arXiv:1905.06893},
year = {2019}
}
备注
Accepted to 3rd Conference on Robot Learning (CoRL 2019); Keywords: Exploration, soft actor-critic, normalizing flow, off-policy; maximum entropy, reinforcement learning; deceptive reward; sparse reward; inverse autoregressive flow