优化策略价值的无偏估计
机器学习
2018-06-08 v1 人工智能
机器学习
摘要
随机试验,亦称 A/B 测试,用于在两个策略间进行选择:一个对照组与一个处理组。给定一组相应特征,我们理想中可学习一个优化策略 P,将 A/B 测试数据特征映射到动作空间并优化奖励。然而,尽管 A/B 测试为部署 B(即从策略 A 切换到 B)的价值提供了无偏估计量,直接应用这些样本来学习优化策略 P 通常无法提供 P 价值的无偏估计量,因为样本是在构造 P 时观测到的。在部署策略的成本与风险较高的情况下,此类无偏估计量极为可取。我们提出一种学习优化策略并获取其部署价值无偏估计的步骤。我们将任意策略学习过程包裹以装袋(bagging)过程,并为每个样本获得袋外(out-of-bag)策略包含决策。随后我们证明,当应用于优化子集时,逆倾向加权效应估计量是无偏的。类似地,我们应用同一思想获得与随机化处理无关的袋外无偏每样本测量价值估计,并利用这些估计构建无偏双重稳健效应估计量。最后,我们通过实证表明,即便平均处理效应为负,我们也能找到正的优化策略。
引用
@article{arxiv.1806.02794,
title = {Unbiased Estimation of the Value of an Optimized Policy},
author = {Elon Portugaly and Joseph J. Pfeiffer},
journal= {arXiv preprint arXiv:1806.02794},
year = {2018}
}