中文

上下文 Bandit 中的最优与自适应离线策略评估

机器学习 2017-11-15 v2 机器学习

摘要

我们在上下文 bandit 模型下研究离线策略评估问题——即使用由另一策略收集的数据来估计目标策略的值。我们考虑无法获得一致奖励模型的一般(不可知)设定,并建立了均方误差(MSE)的极小化极大下界。该下界在常数范围内被逆倾向得分(IPS)和双重稳健(DR)估计器匹配。这突出了不可知上下文设定的困难性,与多臂 bandit 以及能够获得一致奖励模型的上下文 bandit 形成对比,在后两者中 IPS 是次优的。然后,我们提出了 SWITCH 估计器,它可以使用现有的奖励模型(不一定一致)来实现比 IPS 和 DR 更好的偏差-方差权衡。我们证明了其 MSE 的上界,并在多样化的数据集上实证展示了其优势,通常比先前的工作高出几个数量级。

关键词

引用

@article{arxiv.1612.01205,
  title  = {Optimal and Adaptive Off-policy Evaluation in Contextual Bandits},
  author = {Yu-Xiang Wang and Alekh Agarwal and Miroslav Dudik},
  journal= {arXiv preprint arXiv:1612.01205},
  year   = {2017}
}