用于强化学习的生成对抗探索
机器学习
2022-01-28 v1 人工智能
摘要
探索对于训练最优强化学习(RL)策略至关重要,其关键在于判别一个状态访问是否新颖。以往多数工作聚焦于设计启发式规则或距离度量以检查状态是否新颖,而未考虑此类判别过程可被学习。本文提出一种称为生成对抗探索(GAEX)的新方法,通过引入由生成对抗网络输出的内在奖励来鼓励RL中的探索,其中生成器提供状态的伪样本以帮助判别器识别那些较少被访问的状态。因此鼓励智能体去访问那些判别器不太确信已访问的状态。GAEX易于实现且训练效率高。在我们的实验中,我们将GAEX应用于DQN,且DQN-GAEX算法在具有挑战性的探索问题(包括游戏Venture、Montezuma's Revenge与Super Mario Bros)上取得了令人信服的性能,而无需在复杂学习算法上进一步微调。据我们所知,这是首个在RL探索问题中运用GAN的工作。
引用
@article{arxiv.2201.11685,
title = {Generative Adversarial Exploration for Reinforcement Learning},
author = {Weijun Hong and Menghui Zhu and Minghuan Liu and Weinan Zhang and Ming Zhou and Yong Yu and Peng Sun},
journal= {arXiv preprint arXiv:2201.11685},
year = {2022}
}