中文

基于 GAN 的内在探索用于样本高效强化学习

机器学习 2022-06-30 v1 人工智能 计算机视觉与模式识别

摘要

本研究解决强化学习中的高效探索问题。最常见的探索方法依赖于随机动作选择,但这些方法在稀疏或无奖励的环境中表现不佳。我们提出基于生成对抗网络(GAN)的内在奖励模块,该模块学习已观测状态的分布,并将分布外状态的内在奖励计算为较高值,以引导智能体前往未探索状态。我们在无奖励设置的 Super Mario Bros 和稀疏奖励设置的 Montezuma's Revenge 中评估了我们的方法,并表明我们的方法确实能够高效探索。我们讨论了若干弱点,并在讨论未来工作时作结。

关键词

引用

@article{arxiv.2206.14256,
  title  = {GAN-based Intrinsic Exploration For Sample Efficient Reinforcement Learning},
  author = {Doğay Kamar and Nazım Kemal Üre and Gözde Ünal},
  journal= {arXiv preprint arXiv:2206.14256},
  year   = {2022}
}