基于随机编码器的状态熵最大化用于高效探索
机器学习
2021-06-22 v4
摘要
近期的探索方法已被证明是提升深度强化学习(RL)样本效率的良方。然而,在高维观测空间中的高效探索仍具挑战。本文提出随机编码器高效探索(RE3),一种利用状态熵作为内在奖励的探索方法。为在高维观测环境中估计状态熵,我们在卷积编码器的低维表示空间中使用 k 近邻熵估计器。特别地,我们发现利用随机初始化且在训练过程中固定的编码器,可以稳定且计算高效的方式估计状态熵。我们的实验表明,RE3 在 DeepMind Control Suite 与 MiniGrid 基准的 locomotion 与 navigation 任务上,显著提升了无模型与基于模型的 RL 方法的样本效率。我们还表明,RE3 无需外在奖励即可学习多样行为,有效提升下游任务的样本效率。源代码与视频见 https://sites.google.com/view/re3-rl。
引用
@article{arxiv.2102.09430,
title = {State Entropy Maximization with Random Encoders for Efficient Exploration},
author = {Younggyo Seo and Lili Chen and Jinwoo Shin and Honglak Lee and Pieter Abbeel and Kimin Lee},
journal= {arXiv preprint arXiv:2102.09430},
year = {2021}
}
备注
ICML 2021. First two authors contributed equally. Website: https://sites.google.com/view/re3-rl Code: https://github.com/younggyoseo/RE3