中文

面向分布强化学习的全参数化分位数函数

机器学习 2020-08-04 v3 人工智能 机器学习

摘要

分布强化学习(RL)与传统 RL 的不同之处在于,它估计的是分布而非总回报的期望,并已在 Atari 游戏上取得最先进的性能。实用分布 RL 算法的关键挑战在于如何参数化所估计的分布,以更好地逼近真实连续分布。现有的分布 RL 算法要么参数化分布函数的概率侧,要么参数化回报值侧,而将另一侧统一固定(如 C51、QR-DQN)或随机采样(如 IQN)。本文提出全参数化分位数函数,对分布 RL 的分位数比例轴(即 x 轴)与数值轴(即 y 轴)均进行参数化。我们的算法包含一个生成离散分位数比例集合的比例提议网络,以及一个给出相应分位数值的分位数值网络。两网络联合训练以寻找真实分布的最佳逼近。在 55 个 Atari 游戏上的实验表明,我们的算法显著优于现有分布 RL 算法,并为非分布式智能体创造了 Atari 学习环境的新纪录。

关键词

引用

@article{arxiv.1911.02140,
  title  = {Fully Parameterized Quantile Function for Distributional Reinforcement Learning},
  author = {Derek Yang and Li Zhao and Zichuan Lin and Tao Qin and Jiang Bian and Tieyan Liu},
  journal= {arXiv preprint arXiv:1911.02140},
  year   = {2020}
}

备注

NeurIPS 2019. Code at https://github.com/microsoft/FQF