基于 Bellman GAN 的分布型多元策略评估与探索
机器学习
2018-08-07 v1 机器学习
摘要
最近提出的强化学习分布型方法(DiRL)以学习奖励-to-go 的分布为中心,通常称为价值分布。在这项工作中,我们表明驱动 DiRL 方法的分布型 Bellman 方程等价于一个生成对抗网络(GAN)模型。在该表述中,DiRL 可被视为学习价值分布的深度生成模型,由当前价值分布与当前奖励加下一价值之和的分布之间的差异所驱动。我们利用这一见解提出一种基于 GAN 的 DiRL 方法,该方法借助 GAN 在学习高维数据分布方面的优势。特别地,我们展示了我们的 GAN 方法可用于具有多元奖励的 DiRL,这是一个无法用先前方法解决的重要设定。该多元设定还允许我们统一学习价值与状态转移的分布,我们利用这一思想设计了一种由价值和状态估计差异所驱动的新颖探索方法。
引用
@article{arxiv.1808.01960,
title = {Distributional Multivariate Policy Evaluation and Exploration with the Bellman GAN},
author = {Dror Freirich and Ron Meir and Aviv Tamar},
journal= {arXiv preprint arXiv:1808.01960},
year = {2018}
}