从重要性采样到双重稳健策略梯度
机器学习
2020-06-25 v3 机器学习
摘要
我们表明,同策略策略梯度(PG)及其方差缩减变体,可以通过对来自重要性采样(IS)族的非策略评估(OPE)估计器所提供的函数求值取有限差分来推导。从双重稳健(DR)估计器(Jiang & Li, 2016)出发,我们给出了一种非常通用且灵活的 PG 形式的简单推导,它将最先进的方差缩减技术(Cheng et al., 2019)作为特例包含在内,并立即提示了现有文献所忽视的进一步方差缩减机会。我们分析了新 DR-PG 估计器的方差,将其与现有方法以及策略梯度的 Cramer-Rao 下界进行比较,并从经验上展示了其有效性。
引用
@article{arxiv.1910.09066,
title = {From Importance Sampling to Doubly Robust Policy Gradient},
author = {Jiawei Huang and Nan Jiang},
journal= {arXiv preprint arXiv:1910.09066},
year = {2020}
}
备注
ICML 2020