中文

带收缩的双重稳健离屏策略评估

机器学习 2020-09-22 v2 机器学习

摘要

我们提出一种用于设计上下文_bandit(contextual bandits)中离屏策略评估(off-policy evaluation)估计量的新框架。我们的方法基于渐近最优的双重稳健估计量,但我们对重要性权重进行收缩以最小化均方误差的一个界,从而在有限样本中取得更好的偏差-方差权衡。我们利用这一基于优化的框架得到三个估计量:(a) 权重截断估计量,(b) 一种新的权重收缩估计量,以及 (c) 首个面向组合动作集的基于收缩的估计量。在标准和组合_bandit基准问题中的大量实验表明,我们的估计量具有高度适应性,且通常优于最先进的方法。

关键词

引用

@article{arxiv.1907.09623,
  title  = {Doubly robust off-policy evaluation with shrinkage},
  author = {Yi Su and Maria Dimakopoulou and Akshay Krishnamurthy and Miroslav Dudík},
  journal= {arXiv preprint arXiv:1907.09623},
  year   = {2020}
}