中文

通过抛硬币估计伪计数以用于强化学习中的探索

机器学习 2023-06-07 v1 人工智能

摘要

我们提出了一种用于高维状态空间中基于计数的探索的新方法。与依赖密度模型的先前工作不同,我们表明计数可通过平均 Rademacher 分布(或抛硬币)的样本推导得出。该见解用于建立一个简单的监督学习目标,优化该目标可得到状态的访问计数。我们表明,在推断真实访问计数方面,我们的方法比先前工作显著更有效;当用作无模型强化学习算法的探索奖励时,其在 9 个具有挑战性的探索任务(包括 Atari 游戏 Montezuma's Revenge)中的大多数上优于现有方法。

关键词

引用

@article{arxiv.2306.03186,
  title  = {Flipping Coins to Estimate Pseudocounts for Exploration in Reinforcement Learning},
  author = {Sam Lobel and Akhil Bagaria and George Konidaris},
  journal= {arXiv preprint arXiv:2306.03186},
  year   = {2023}
}

备注

11 pages (+9 appendix). Published as a conference paper at ICML 2023. Code available at https://github.com/samlobel/CFN/