用于 Slate 离屏策略评估的控制变量法
机器学习
2021-11-04 v3 统计方法学
摘要
我们研究从具有多维动作(常称为 slate)的批处理上下文_bandit 数据中进行离屏策略评估的问题。该问题在推荐系统与用户界面优化中很常见,并且由于组合大小的行动空间而尤其具有挑战性。Swaminathan 等人(2017)在条件均值奖励对动作可加的假设下提出了伪逆(PI)估计量。利用控制变量,我们考虑了一大类无偏估计量,其具体情形包含 PI 估计量以及(渐近地)其自归一化变体。通过在该类上优化,我们获得了相对于 PI 与自归一化 PI 估计量均具有风险改进保证的新估计量。使用真实世界推荐数据以及合成数据的实验在实践中验证了这些改进。
引用
@article{arxiv.2106.07914,
title = {Control Variates for Slate Off-Policy Evaluation},
author = {Nikos Vlassis and Ashok Chandrashekar and Fernando Amat Gil and Nathan Kallus},
journal= {arXiv preprint arXiv:2106.07914},
year = {2021}
}