用于离屏策略推断的引导拟合 Q 评估
机器学习
2022-05-24 v3 机器学习
统计理论
统计理论
摘要
引导法为评估批量强化学习的质量提供了灵活而有效的途径,但其理论性质尚少被理解。本文研究引导法在离屏策略评估(OPE)中的使用,特别地,我们聚焦于在表格与线性模型情形下已知为极小极大最优的拟合 Q 评估(FQE)。我们提出一种引导 FQE 方法用于推断策略评估误差的分布,并证明该方法在离屏策略统计推断中是渐近有效且分布一致的。为克服引导法的计算限制,我们进一步采用子采样过程,将运行时间提升一个数量级。我们在经典 RL 环境中对引导法进行了数值评估,用于置信区间估计、估计离屏策略评估器的方差,以及估计多个离屏策略评估器之间的相关性。
引用
@article{arxiv.2102.03607,
title = {Bootstrapping Fitted Q-Evaluation for Off-Policy Inference},
author = {Botao Hao and Xiang Ji and Yaqi Duan and Hao Lu and Csaba Szepesvári and Mengdi Wang},
journal= {arXiv preprint arXiv:2102.03607},
year = {2022}
}
备注
Accepted at ICML 2021