MULEX:在深度强化学习中解耦利用与探索
机器学习
2019-07-02 v1 人工智能
机器学习
摘要
通过交互学习的智能体应在探测环境以发现新奖励与利用过去获取的信息采取有用行为之间,平衡其动作选择过程。这种权衡通常通过扰动智能体的动作(如 ε-greedy 或 Gibbs 采样)、扰动智能体的参数(如 NoisyNet),或修改其接收的奖励(如探索奖励、内在动机或人工塑形奖励)来实现。在此,我们采用一种颠覆性但简单且通用的视角,显式解耦探索与利用。不同的损失被并行优化,其中之一来自真实目标(最大化来自环境的累积奖励),其余与探索相关。每个损失轮流用于学习生成转移的策略,所有转移共享于单一回放缓冲区中。然后对这些转移应用离策略方法以优化各损失。我们在困难探索环境上展示了我们的方法,显示了其样本效率与鲁棒性,并讨论了进一步的意义。
引用
@article{arxiv.1907.00868,
title = {MULEX: Disentangling Exploitation from Exploration in Deep RL},
author = {Lucas Beyer and Damien Vincent and Olivier Teboul and Sylvain Gelly and Matthieu Geist and Olivier Pietquin},
journal= {arXiv preprint arXiv:1907.00868},
year = {2019}
}