中文

CAB:用于策略评估与学习的连续自适应混合估计器

机器学习 2019-08-30 v4 机器学习

摘要

使用记录下的情境_bandit反馈执行离线A/B测试与离策略学习的能力,在包括推荐系统、搜索引擎、广告投放和个性化医疗的广泛应用领域中极具价值。离线A/B测试与离策略学习均需要一个反事实估计器,用以评估若采用某新策略替代记录策略时其原本的表现。本文中,我们界定了一族反事实估计器,其涵盖了迄今提出的大多数此类估计器。对该族的分析识别出一种新的估计器——称为连续自适应混合(CAB)——其具备诸多有利的理论与实际性质。特别地,它可比截断逆倾向得分(IPS)加权和直接法显著减小偏差,且可具有比双鲁棒与IPS估计器更小的方差。此外,它是次可微的,因而不同于SWITCH估计器,可用于学习。实验结果表明,CAB提供优异的评估精度,并在学习性能方面优于其他反事实估计器。

关键词

引用

@article{arxiv.1811.02672,
  title  = {CAB: Continuous Adaptive Blending Estimator for Policy Evaluation and Learning},
  author = {Yi Su and Lequn Wang and Michele Santacatterina and Thorsten Joachims},
  journal= {arXiv preprint arXiv:1811.02672},
  year   = {2019}
}