SEREN:知晓何时探索与何时利用
机器学习
2022-07-01 v1
摘要
高效的强化学习(RL)涉及“利用”动作(最大化期望奖励)与“探索”动作(采样未访问状态)之间的权衡。为鼓励探索,近期方法提出向动作添加随机性、分离探索与利用阶段,或将不确定性的降低等同于奖励。然而,这些技术未必提供完全系统化的权衡方法。在此我们引入选择性强化探索网络(SEREN),将探索-利用权衡建模为一个博弈:一个 RL 智能体——\exploiter,纯粹利用已知奖励;另一个 RL 智能体——\switcher,选择在哪些状态激活纯粹的探索策略,该策略被训练为最小化系统不确定性并覆盖 Exploiter。利用一种称为脉冲控制的策略形式,\switcher 能够确定切换到探索策略的最佳状态集合,而 Exploiter 可在其余所有地方自由执行其动作。我们证明 SEREN 收敛迅速,并诱导出朝向纯粹利用的自然调度。通过在离散(MiniGrid)和连续(MuJoCo)控制基准上的广泛实证研究,我们表明 SEREN 可轻易与现有 RL 算法结合,相较最先进算法取得显著的性能提升。
引用
@article{arxiv.2205.15064,
title = {SEREN: Knowing When to Explore and When to Exploit},
author = {Changmin Yu and David Mguni and Dong Li and Aivar Sootla and Jun Wang and Neil Burgess},
journal= {arXiv preprint arXiv:2205.15064},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2112.02618, arXiv:2103.09159, arXiv:2110.14468