基于双重拟合迭代的离屏策略梯度最优估计
机器学习
2022-06-22 v3 机器学习
摘要
当我们不被允许使用目标策略进行采样,而只能访问由某个未知行为策略生成的数据集时,策略梯度(PG)估计便成为一项挑战。传统的离屏策略 PG 估计方法往往存在显著偏差或指数级大的方差。在本文中,我们提出了双重拟合 PG 估计(FPG)算法。FPG 可适用于任意策略参数化,并假设可访问一个 Bellman 完备的值函数类。在线性值函数逼近的情况下,我们给出了策略梯度估计误差的紧有限样本上界,该上界由特征空间中度量的分布失配程度所控制。我们还建立了 FPG 估计误差的渐近正态性并给出了精确的协方差刻画,进一步证明其在统计上是最优的,并匹配了 Cramer-Rao 下界。在实验上,我们使用 softmax 表格或 ReLU 策略网络,在策略梯度估计和策略优化两方面评估了 FPG 的性能。在各种指标下,我们的结果表明 FPG 显著优于现有的基于重要性采样和方差缩减技术的离屏策略 PG 估计方法。
引用
@article{arxiv.2202.00076,
title = {Optimal Estimation of Off-Policy Policy Gradient via Double Fitted Iteration},
author = {Chengzhuo Ni and Ruiqi Zhang and Xiang Ji and Xuezhou Zhang and Mengdi Wang},
journal= {arXiv preprint arXiv:2202.00076},
year = {2022}
}