中文

从重要性采样到双重稳健策略梯度

机器学习 2020-06-25 v3 机器学习

摘要

我们表明,同策略策略梯度(PG)及其方差缩减变体,可以通过对来自重要性采样(IS)族的非策略评估(OPE)估计器所提供的函数求值取有限差分来推导。从双重稳健(DR)估计器(Jiang & Li, 2016)出发,我们给出了一种非常通用且灵活的 PG 形式的简单推导,它将最先进的方差缩减技术(Cheng et al., 2019)作为特例包含在内,并立即提示了现有文献所忽视的进一步方差缩减机会。我们分析了新 DR-PG 估计器的方差,将其与现有方法以及策略梯度的 Cramer-Rao 下界进行比较,并从经验上展示了其有效性。

关键词

引用

@article{arxiv.1910.09066,
  title  = {From Importance Sampling to Doubly Robust Policy Gradient},
  author = {Jiawei Huang and Nan Jiang},
  journal= {arXiv preprint arXiv:1910.09066},
  year   = {2020}
}

备注

ICML 2020