深度强化学习中基于扰动的探索方法
机器学习
2020-11-12 v1 人工智能
摘要
近期关于结构化探索的研究强调识别状态空间中的新颖状态,并通过内在奖励激励智能体重访它们。在本研究中,我们质疑这些方法所展现的性能提升确实源于智能体探索调度中结构的发现,还是该收益在很大程度上归因于在追求结构化探索过程中策略与奖励空间中的扰动。本研究考察策略与奖励空间中的扰动对智能体探索行为的影响。我们进而表明,在softmax层之前简单地扰动策略以及向领域引入偶发奖励,可大幅增强街机学习环境若干领域中的探索。鉴于这些发现,我们建议任何结构化探索研究的改进都应以噪声探索为基准进行比较。
引用
@article{arxiv.2011.05446,
title = {Perturbation-based exploration methods in deep reinforcement learning},
author = {Sneha Aenugu},
journal= {arXiv preprint arXiv:2011.05446},
year = {2020}
}