无限时域离策略估计中的双重稳健偏差减小
机器学习
2019-10-17 v1 人工智能
机器学习
摘要
无限时域离策略策略评估是一项极具挑战性的任务,因为典型的重要性采样(IS)估计量具有过大的方差。最近,Liu等人(2018a)提出了一种通过估计平稳密度比来显著降低无限时域离策略评估方差的方法,但代价是由于密度比估计误差而引入潜在的高偏差。在本文中,我们开发了该方法的一种偏差减小的增强版本,它可以利用学习到的价值函数来获得更高的精度。我们的方法是双重稳健的,因为当密度比或价值函数估计中任何一个完美时,偏差都会消失。一般来说,当其中任何一个准确时,偏差也可以减小。理论和实证结果均表明,我们的方法相比先前的方法具有显著优势。
引用
@article{arxiv.1910.07186,
title = {Doubly Robust Bias Reduction in Infinite Horizon Off-Policy Estimation},
author = {Ziyang Tang and Yihao Feng and Lihong Li and Dengyong Zhou and Qiang Liu},
journal= {arXiv preprint arXiv:1910.07186},
year = {2019}
}