中文

贝叶斯风险下石板策略的离屏策略评估

机器学习 2021-01-08 v1 统计理论 机器学习 统计理论

摘要

我们研究石板_bandit的离屏策略评估问题,针对日志策略在石板各槽位上可分解这一典型情形。我们略微偏离现有文献,以贝叶斯风险作为评估估计量的准则,并分析了包含 Swaminathan 等人(2017; arXiv:1605.04812)的伪逆(PI)估计量在内的“加性”估计量族。利用控制变量法,我们识别出该族中一个新的估计量,它在上述一类问题上保证具有低于 PI 的风险。特别地,我们表明相对于 PI 的风险改进随槽位数线性增长,并随日志策略与目标策略之间一组槽位级散度的算术平均与调和平均之差线性增长。在均匀日志策略与确定性目标策略的典型情形下,每个散度对应于槽位大小,表明对于各槽位动作数各异的石板问题可获得最大收益。

关键词

引用

@article{arxiv.2101.02553,
  title  = {Off-Policy Evaluation of Slate Policies under Bayes Risk},
  author = {Nikos Vlassis and Fernando Amat Gil and Ashok Chandrashekar},
  journal= {arXiv preprint arXiv:2101.02553},
  year   = {2021}
}