中文

通过自归一化重要性加权进行置信的离线策略评估与选择

机器学习 2022-03-22 v3 机器学习

摘要

我们考虑上下文赌博机设置中的离线策略评估,目的是获得稳健的离线策略选择策略,其中选择策略根据一组提议(目标)策略中所选策略的价值进行评估。我们提出了一种新方法,用于在上下文赌博机中给定一些记录数据的情况下,计算任意目标策略价值的下界,以达到期望的覆盖率。该下界建立在所谓的自归一化重要性加权(SN)估计器之上。它结合了使用半经验Efron-Stein尾部不等式来控制集中性,以及一种新的乘法(而非加法)偏差控制。该新方法在多个合成和真实数据集上进行了评估,发现在置信区间的紧密度和所选策略的质量方面均优于其主要竞争对手。

关键词

引用

@article{arxiv.2006.10460,
  title  = {Confident Off-Policy Evaluation and Selection through Self-Normalized Importance Weighting},
  author = {Ilja Kuzborskij and Claire Vernade and András György and Csaba Szepesvári},
  journal= {arXiv preprint arXiv:2006.10460},
  year   = {2022}
}