带状态分布修正的离屏策略梯度方法
机器学习
2019-07-09 v2 人工智能
机器学习
摘要
我们研究马尔可夫决策过程中的离屏策略优化问题,并提出了一种新颖的离屏策略梯度方法。先前的离屏策略梯度方法通常忽略了用于收集数据的行为策略下所访问状态分布与所学策略下状态分布之间的不匹配。本文基于近期在估计行为策略与评估策略下状态分布之比以进行策略评估方面的进展,提出了一种离屏策略梯度优化技术,该技术能够考虑这种分布上的不匹配。我们给出一个说明性示例解释其重要性,并为我们的方法提供了理论收敛保证。在实证中,我们在仿真中将我们的方法与几种未对此不匹配进行修正的强基线进行比较,在所发现策略的质量上取得了显著提升。
引用
@article{arxiv.1904.08473,
title = {Off-Policy Policy Gradient with State Distribution Correction},
author = {Yao Liu and Adith Swaminathan and Alekh Agarwal and Emma Brunskill},
journal= {arXiv preprint arXiv:1904.08473},
year = {2019}
}
备注
to appear at UAI 18; camera-ready version