基于 GAN 的内在探索用于样本高效强化学习
机器学习
2022-06-30 v1 人工智能
计算机视觉与模式识别
摘要
本研究解决强化学习中的高效探索问题。最常见的探索方法依赖于随机动作选择,但这些方法在稀疏或无奖励的环境中表现不佳。我们提出基于生成对抗网络(GAN)的内在奖励模块,该模块学习已观测状态的分布,并将分布外状态的内在奖励计算为较高值,以引导智能体前往未探索状态。我们在无奖励设置的 Super Mario Bros 和稀疏奖励设置的 Montezuma's Revenge 中评估了我们的方法,并表明我们的方法确实能够高效探索。我们讨论了若干弱点,并在讨论未来工作时作结。
引用
@article{arxiv.2206.14256,
title = {GAN-based Intrinsic Exploration For Sample Efficient Reinforcement Learning},
author = {Doğay Kamar and Nazım Kemal Üre and Gözde Ünal},
journal= {arXiv preprint arXiv:2206.14256},
year = {2022}
}