离屏策略评估中的自适应估计器选择
机器学习
2020-08-25 v2 统计理论
机器学习
统计理论
摘要
我们开发了一种通用的数据驱动方法,用于离屏策略评估环境中的估计器选择。我们为该方法建立了强有力的性能保证,表明其与预言估计器相比具有竞争力,仅相差一个常数因子。通过上下文_bandit和强化学习中的深入案例研究,我们展示了该方法的通用性与适用性。我们还进行了全面的实验,证明了我们方法的经验有效性并与相关方法进行了比较。在两个案例研究中,我们的方法均优于现有方法。
引用
@article{arxiv.2002.07729,
title = {Adaptive Estimator Selection for Off-Policy Evaluation},
author = {Yi Su and Pavithra Srinath and Akshay Krishnamurthy},
journal= {arXiv preprint arXiv:2002.07729},
year = {2020}
}
备注
Fixed some typos. Published in ICML 2020