中文

来自自组织特征图的内在奖励用于强化学习中的探索

机器学习 2023-02-09 v1

摘要

我们引入了一种使用自组织特征图计算的深度强化学习方法探索奖励。我们的方法利用自适应共振理论(ART)提供在线无监督聚类来量化状态的新颖性。该启发式被用于向外在奖励信号添加一个内在奖励,从而优化智能体以最大化这两种奖励之和。我们发现,该方法能够在与 ICM arXiv:1705.05464 相当的训练周期数后达到人类水平的 Ordeal 游戏表现。在我们的超参数空间内,增强了 RND arXiv:1810.12894 的智能体未能达到相同的性能水平。

关键词

引用

@article{arxiv.2302.04125,
  title  = {Intrinsic Rewards from Self-Organizing Feature Maps for Exploration in Reinforcement Learning},
  author = {Marius Lindegaard and Hjalmar Jacob Vinje and Odin Aleksander Severinsen},
  journal= {arXiv preprint arXiv:2302.04125},
  year   = {2023}
}

备注

10 pages, 4 figures. Code publicly available at https://github.com/mariuslindegaard/curiosity_baselines