用于分布式强化学习的隐式分位数网络
机器学习
2018-06-20 v1 人工智能
机器学习
摘要
在这项工作中,我们基于分布式强化学习的近期进展,给出一种普遍适用、灵活且最先进的 DQN 分布式变体。我们通过使用分位数回归来近似状态-动作回报分布的完整分位数函数来实现这一点。通过对样本空间上的分布重新参数化,这产生了隐式定义的回报分布,并引出一大类风险敏感策略。我们在 ALE 中的 57 个 Atari 2600 游戏上展示了性能提升,并利用我们算法的隐式定义分布来研究 Atari 游戏中风险敏感策略的影响。
引用
@article{arxiv.1806.06923,
title = {Implicit Quantile Networks for Distributional Reinforcement Learning},
author = {Will Dabney and Georg Ostrovski and David Silver and Rémi Munos},
journal= {arXiv preprint arXiv:1806.06923},
year = {2018}
}
备注
ICML 2018