中文

用于分布式强化学习的隐式分位数网络

机器学习 2018-06-20 v1 人工智能 机器学习

摘要

在这项工作中,我们基于分布式强化学习的近期进展,给出一种普遍适用、灵活且最先进的 DQN 分布式变体。我们通过使用分位数回归来近似状态-动作回报分布的完整分位数函数来实现这一点。通过对样本空间上的分布重新参数化,这产生了隐式定义的回报分布,并引出一大类风险敏感策略。我们在 ALE 中的 57 个 Atari 2600 游戏上展示了性能提升,并利用我们算法的隐式定义分布来研究 Atari 游戏中风险敏感策略的影响。

关键词

引用

@article{arxiv.1806.06923,
  title  = {Implicit Quantile Networks for Distributional Reinforcement Learning},
  author = {Will Dabney and Georg Ostrovski and David Silver and Rémi Munos},
  journal= {arXiv preprint arXiv:1806.06923},
  year   = {2018}
}

备注

ICML 2018