中文

离屏策略评估中的自适应估计器选择

机器学习 2020-08-25 v2 统计理论 机器学习 统计理论

摘要

我们开发了一种通用的数据驱动方法,用于离屏策略评估环境中的估计器选择。我们为该方法建立了强有力的性能保证,表明其与预言估计器相比具有竞争力,仅相差一个常数因子。通过上下文_bandit和强化学习中的深入案例研究,我们展示了该方法的通用性与适用性。我们还进行了全面的实验,证明了我们方法的经验有效性并与相关方法进行了比较。在两个案例研究中,我们的方法均优于现有方法。

关键词

引用

@article{arxiv.2002.07729,
  title  = {Adaptive Estimator Selection for Off-Policy Evaluation},
  author = {Yi Su and Pavithra Srinath and Akshay Krishnamurthy},
  journal= {arXiv preprint arXiv:2002.07729},
  year   = {2020}
}

备注

Fixed some typos. Published in ICML 2020