具有线性函数逼近的方差感知离屏策略评估
机器学习
2022-01-05 v2 最优化与控制
机器学习
摘要
我们研究具有线性函数逼近的强化学习中的离屏策略评估(OPE)问题,旨在基于由行为策略收集的离线数据估计目标策略的价值函数。我们提出融入价值函数的方差信息以提升OPE的样本效率。更具体地,对于时间非齐次的片段式线性马尔可夫决策过程(MDP),我们提出一种算法VA-OPE,其利用估计的价值函数方差对拟合Q迭代中的贝尔曼残差进行重加权。我们表明该算法获得了比已知最优结果更紧的误差界。我们还对行为策略与目标策略之间的分布偏移给出了细粒度刻画。大量数值实验佐证了我们的理论。
引用
@article{arxiv.2106.11960,
title = {Variance-Aware Off-Policy Evaluation with Linear Function Approximation},
author = {Yifei Min and Tianhao Wang and Dongruo Zhou and Quanquan Gu},
journal= {arXiv preprint arXiv:2106.11960},
year = {2022}
}
备注
59 pages, 4 figures. In NeurIPS 2021