中文

跨众多弱实验评估决策规则

统计方法学 2025-05-30 v2

摘要

技术公司通过进行随机对照实验('A/B 测试')来学习哪些行动可以改善业务结果。在拥有成熟实验平台的公司中,实验项目可以包含数千项测试。为了有效扩展实验,企业依赖决策规则:将实验结果映射到选择要推广至整个用户群体的处理 arm 的标准操作程序。尽管决策规则在将实验转化为业务决策方面发挥着关键作用,但关于如何评估和选择决策规则的严格指导方面仍显稀缺。本文提出以累计业务北极指标收益来评估决策规则。虽然这一量度直观且易于向决策者解释,但在实验信噪比较弱时估计这一量会很困难,尤其是当实验信号与噪声比率较弱时。我们发展了一种在数字实验中符合现实条件的交叉验证估计器,其偏差远低于粗略插值估计器。在我们通过 Netflix 123 项历史 A/B 测试的案例研究中,我们展示了该方法的有效性,通过该方法我们证明,新的决策规则将通过北极指标实现约 33% 的累计收益提升,直接导致了该新规则的采纳。

关键词

引用

@article{arxiv.2502.08763,
  title  = {Evaluating Decision Rules Across Many Weak Experiments},
  author = {Winston Chou and Colin Gray and Nathan Kallus and Aurélien Bibaut and Simon Ejdemyr},
  journal= {arXiv preprint arXiv:2502.08763},
  year   = {2025}
}

备注

Proceedings of the 31st ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '25), August 3--7, 2025, Toronto, ON, Canada