中文

数据驱动的离屏估计器选择:在在线内容分发服务用户营销中的应用

人工智能 2021-09-20 v1

摘要

离屏评估(Off-policy evaluation, OPE)是一种利用由不同策略生成的历史数据来估计决策策略性能的方法,无需进行代价高昂的在线 A/B 测试。准确的 OPE 在医疗、营销或推荐系统等领域至关重要,以避免部署性能不佳的策略,因为此类策略可能危害人类生命或破坏用户体验。因此,许多具有理论背景的 OPE 方法已被提出。这一趋势带来的一个新兴挑战是,合适的估计器可能因每个应用场景而异。从业者通常不知道对其特定应用和目的应使用哪种估计器。为了在众多候选者中找出合适的估计器,我们采用一种数据驱动的估计器选择流程作为离屏策略性能估计器的实用解决方案。作为概念验证,我们使用我们的流程在真实世界的在线内容分发服务上选择最佳估计器来评估优惠券处理(coupon treatment)策略。在实验中,我们首先观察到合适的估计器可能随结果变量(outcome variable)的不同定义而改变,因此准确的估计器选择在 OPE 的实际应用中至关重要。然后,我们展示了通过利用估计器选择流程,我们可以轻松找出适合各目的的估计器。

关键词

引用

@article{arxiv.2109.08621,
  title  = {Data-Driven Off-Policy Estimator Selection: An Application in User Marketing on An Online Content Delivery Service},
  author = {Yuta Saito and Takuma Udagawa and Kei Tateno},
  journal= {arXiv preprint arXiv:2109.08621},
  year   = {2021}
}

备注

presented at REVEAL workshop, RecSys2020