中文

芒豪森强化学习

机器学习 2020-11-05 v3 机器学习

摘要

自举是强化学习(RL)的核心机制。大多数基于时序差分的算法将转移状态的真实价值替换为其当前估计值。然而,另一种估计也可用于自举RL:当前策略。我们的核心贡献在于一个极简想法:将缩放的对数策略加到即时奖励上。我们表明,以该方式轻微修改深度Q网络(DQN)所得智能体在Atari游戏上与分布式方法相当,且未使用分布式RL、n步回报或优先回放。为证明该思想的通用性,我们亦将其与隐式分位数网络(IQN)结合使用。所得智能体在Atari上超越Rainbow,以对原算法极少的修改确立了新的最先进水平(State of the Art)。除这一实证研究外,我们提供了关于其内部机理的强理论洞见——隐式Kullback-Leibler正则化与动作间隙(action-gap)的扩大。

关键词

引用

@article{arxiv.2007.14430,
  title  = {Munchausen Reinforcement Learning},
  author = {Nino Vieillard and Olivier Pietquin and Matthieu Geist},
  journal= {arXiv preprint arXiv:2007.14430},
  year   = {2020}
}

备注

NeurIPS 2020. Code: https://github.com/google-research/google-research/tree/master/munchausen_rl