中文

面向长期结果的定向干预

机器学习 2022-04-12 v2 应用统计 机器学习

摘要

决策者通常希望定向干预以最大化仅在长期才能观测到的结果。这通常要求将决策推迟到结果观测之后,或依赖长期结果的简单短期代理变量。本文基于统计替代与策略学习文献,对缺失的长期结果进行插补,然后通过双重稳健方法在插补结果上近似最优定向策略。我们首先证明,使用插补结果进行平均处理效应估计的有效性条件对于策略评估与优化同样充分;此外,对于策略优化这些条件可适度放宽。我们将该方法应用于《波士顿环球报》的两项大规模主动流失管理实验,通过向其数字订阅者定向最优折扣以最大化长期收益。利用第一项实验,我们通过比较基于插补结果学习的策略与基于真实长期结果学习的策略,对方法进行实证评估。这两种策略的表现统计上不可区分,且我们排除了依赖替代变量带来的重大损失。我们的方法也优于基于长期结果的短期代理变量学习的策略。在第二项现场实验中,我们实施了带额外随机探索的最优定向策略,从而能为未来订阅者更新最优策略。三年内,与现状相比,我们的方法带来了约 400 至 500 万美元的净正收益影响。

关键词

引用

@article{arxiv.2010.15835,
  title  = {Targeting for long-term outcomes},
  author = {Jeremy Yang and Dean Eckles and Paramveer Dhillon and Sinan Aral},
  journal= {arXiv preprint arXiv:2010.15835},
  year   = {2022}
}

备注

main text is 27 pages, with 3 figures and 1 table