用于强化学习中探索加速的Rényi状态熵
机器学习
2022-06-02 v1 人工智能
摘要
深度强化学习中最关键的挑战之一是维持智能体的长期探索能力。为解决该问题,近期有人提出为智能体提供内在奖励以鼓励探索。然而,文献中多数现有的基于内在奖励的方法未能提供可持续的探索激励,即所谓的奖励消失问题。此外,这些传统方法在学习过程中引入了复杂模型和额外内存,导致高计算复杂度和低鲁棒性。本工作中,提出一种基于Rényi熵的新型内在奖励模块以提供高质量内在奖励。研究表明,所提方法实际上推广了现有的状态熵最大化方法。特别地,引入 近邻估计器进行熵估计,并设计 值搜索方法以保证估计精度。大量仿真结果表明,所提基于Rényi熵的方法相比现有方案可获得更高性能。
引用
@article{arxiv.2203.04297,
title = {R\'enyi State Entropy for Exploration Acceleration in Reinforcement Learning},
author = {Mingqi Yuan and Man-on Pun and Dong Wang},
journal= {arXiv preprint arXiv:2203.04297},
year = {2022}
}
备注
10 pages, 6 figures. arXiv admin note: substantial text overlap with arXiv:2203.02298